Hugging Face 논문AI · 머신러닝오늘의 주요

LLM 에이전트의 장기 작업 검증 성능 6배 향상

원제 VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

추천 15댓글 2Caiqi Zhang, Rujun Han, Zifeng Wang 외
Key Point

장기 작업을 수행하는 AI 에이전트 시스템의 신뢰성 검증 방식이 근본적으로 달라지는 기술로, 다중 시도 결과의 품질 판별 문제를 자동으로 해결할 수 있다.

핵심 요약

  • LLM 에이전트가 복잡한 장기 작업을 수행할 때 출력 검증이 어려워지는 문제를 다룬다.
  • 여러 번 샘플링한 결과물들이 서로 다른 올바른 주장들을 담을 수 있지만, 어느 것을 믿을지 판단할 신뢰할 수 있는 검증 메커니즘이 필요하다.
  • 의견 불일치는 올바른 대안을 드러내는 경향이 있고, 합의는 오류를 숨길 수 있다는 관찰에서 VeriHarness를 제안한다.
  • VeriHarness는 기반 LLM을 작업 공간, 증거 도구, 재사용 가능한 검증 스킬을 제공해 에이전틱 검증자로 변환한다.
  • 불일치 해결자는 경쟁하는 주장들을 환경 증거와 대조하고, 합의 도전자는 공유 주장들을 테스트하며 빠진 요구사항을 찾는다.
  • 5개 장기 작업 벤치마크와 2개 최신 모델에서 VeriHarness는 평가된 기준선 중 가장 높은 선택 점수를 달성했다.
  • 증거 기반 수정을 통해 단일 샘플링 대비 Gemini 3.5 Flash에서 6.2점, Claude Opus에서 6.4점의 성능 향상을 보였다.
  • 검증 스킬은 실패 피드백에서 자가개선 가능함을 보였으며, 약 26,000개 롤아웃 데이터셋을 공개했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗