Hugging Face 논문AI · 머신러닝오늘의 주요

LLM이 외부 지침을 선별하는 법: 신뢰성 판단과 거부 능력

원제 Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?

추천 60댓글 1Minghan Wang, Boyuan Wang, Jinhang Zuo 외
Key Point

생성형 AI를 에이전트로 운영할 때 외부 지침에 무조건 따르는 것이 항상 최선은 아니라는 점을 실증적으로 증명하며, 모델이 거짓 지침을 거부하고 참 지침만 선별하는 능력을 어떻게 학습시킬 수 있는지를 다룬다.

핵심 요약

  • 모델이 성능이 높아질수록 인간이 설계한 워크플로우 지침이 부정확해졌을 때 실행을 제약하는 문제를 지적한다.
  • 이 논문은 '생각의 틀 밖으로' 나가는 능력을 정의하는데, 유용한 지침은 따르면서 신뢰할 수 없는 지침은 무시하는 능력을 뜻한다.
  • Box²-Bench라는 벤치마크를 제시해 모델과 작업을 고정하되 워크플로우 신뢰성만 변동시켜 지침 의존도를 측정한다.
  • 최신 모델들은 신뢰할 수 있는 지침에는 잘 반응하지만 잘못되었거나 신뢰할 수 없는 지침에는 여전히 취약하다.
  • 연구진은 나쁜 워크플로우로 학습시키고 좋은 워크플로우로 평가하는 두 가지 학습 전략을 시도했다: 반사실적 감독형 미세조정으로 견고성을 개선하고, 결과 기반 강화학습으로 도움되는 워크플로우 사용 비중을 높인다.
  • 이 능력은 워크플로우를 넘어 동료 피드백 개선과 손상된 메모리에 대한 견고성으로도 확장된다.
  • 궁극적으로 불완전한 외부 정보에 대한 선별적 의존이 작업 성능만으로는 포착되지 않는 에이전트 신뢰성의 새로운 측면임을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗