LLM 에이전트의 장기 작업 검증 성능 6배 향상
원제 VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks
추천 15댓글 2
Key Point
장기 작업을 수행하는 AI 에이전트 시스템의 신뢰성 검증 방식이 근본적으로 달라지는 기술로, 다중 시도 결과의 품질 판별 문제를 자동으로 해결할 수 있다.
핵심 요약
- LLM 에이전트가 복잡한 장기 작업을 수행할 때 출력 검증이 어려워지는 문제를 다룬다.
- 여러 번 샘플링한 결과물들이 서로 다른 올바른 주장들을 담을 수 있지만, 어느 것을 믿을지 판단할 신뢰할 수 있는 검증 메커니즘이 필요하다.
- 의견 불일치는 올바른 대안을 드러내는 경향이 있고, 합의는 오류를 숨길 수 있다는 관찰에서 VeriHarness를 제안한다.
- VeriHarness는 기반 LLM을 작업 공간, 증거 도구, 재사용 가능한 검증 스킬을 제공해 에이전틱 검증자로 변환한다.
- 불일치 해결자는 경쟁하는 주장들을 환경 증거와 대조하고, 합의 도전자는 공유 주장들을 테스트하며 빠진 요구사항을 찾는다.
- 5개 장기 작업 벤치마크와 2개 최신 모델에서 VeriHarness는 평가된 기준선 중 가장 높은 선택 점수를 달성했다.
- 증거 기반 수정을 통해 단일 샘플링 대비 Gemini 3.5 Flash에서 6.2점, Claude Opus에서 6.4점의 성능 향상을 보였다.
- 검증 스킬은 실패 피드백에서 자가개선 가능함을 보였으며, 약 26,000개 롤아웃 데이터셋을 공개했다.