LLM이 외부 지침을 선별하는 법: 신뢰성 판단과 거부 능력
원제 Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?
추천 60댓글 1
Key Point
생성형 AI를 에이전트로 운영할 때 외부 지침에 무조건 따르는 것이 항상 최선은 아니라는 점을 실증적으로 증명하며, 모델이 거짓 지침을 거부하고 참 지침만 선별하는 능력을 어떻게 학습시킬 수 있는지를 다룬다.
핵심 요약
- 모델이 성능이 높아질수록 인간이 설계한 워크플로우 지침이 부정확해졌을 때 실행을 제약하는 문제를 지적한다.
- 이 논문은 '생각의 틀 밖으로' 나가는 능력을 정의하는데, 유용한 지침은 따르면서 신뢰할 수 없는 지침은 무시하는 능력을 뜻한다.
- Box²-Bench라는 벤치마크를 제시해 모델과 작업을 고정하되 워크플로우 신뢰성만 변동시켜 지침 의존도를 측정한다.
- 최신 모델들은 신뢰할 수 있는 지침에는 잘 반응하지만 잘못되었거나 신뢰할 수 없는 지침에는 여전히 취약하다.
- 연구진은 나쁜 워크플로우로 학습시키고 좋은 워크플로우로 평가하는 두 가지 학습 전략을 시도했다: 반사실적 감독형 미세조정으로 견고성을 개선하고, 결과 기반 강화학습으로 도움되는 워크플로우 사용 비중을 높인다.
- 이 능력은 워크플로우를 넘어 동료 피드백 개선과 손상된 메모리에 대한 견고성으로도 확장된다.
- 궁극적으로 불완전한 외부 정보에 대한 선별적 의존이 작업 성능만으로는 포착되지 않는 에이전트 신뢰성의 새로운 측면임을 보여준다.