LLM이 외부 지침을 선별하는 법: 신뢰성 판단과 거부 능력
Key Point
생성형 AI를 에이전트로 운영할 때 외부 지침에 무조건 따르는 것이 항상 최선은 아니라는 점을 실증적으로 증명하며, 모델이 거짓 지침을 거부하고 참 지침만 선별하는 능력을 어떻게 학습시킬 수 있는지를 다룬다.
핵심 요약
- 모델이 성능이 높아질수록 인간이 설계한 워크플로우 지침이 부정확해졌을 때 실행을 제약하는 문제를 지적한다.
- 이 논문은 '생각의 틀 밖으로' 나가는 능력을 정의하는데, 유용한 지침은 따르면서 신뢰할 수 없는 지침은 무시하는 능력을 뜻한다.
- Box²-Bench라는 벤치마크를 제시해 모델과 작업을 고정하되 워크플로우 신뢰성만 변동시켜 지침 의존도를 측정한다.