Hugging Face 논문AI · 머신러닝오늘의 주요

LLM 에이전트의 '안목' 측정 벤치마크 공개

원제 The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

추천 58댓글 1Wenbo Pan, Zhichao Liu, Shujie Liu 외
Key Point

장시간 작업을 수행하는 AI 에이전트의 핵심 약점인 '의사결정 능력'을 체계적으로 측정할 수 있는 첫 벤치마크이며, 어떤 조건에서 의사결정이 어려워지는지 파악할 수 있다.

핵심 요약

  • 장시간 작업에서 LLM 에이전트가 어느 방향으로 나아갈지 결정하는 능력을 '안목'(taste)이라 정의하고, 이를 평가하는 Taste-Bench 벤치마크를 개발했다.
  • 병렬 시도나 궤적 내 우회를 분석해 자동으로 결정 지점(decision fork)을 추출하고, 각 지점에서 여러 선택지 중 더 나은 결과로 이어진 것을 찾도록 모델을 평가한다.
  • 최고 성능 모델도 정확히 59.7%의 질문에만 답했으며, 결정 근거가 뒤에 나타날수록 모든 모델의 정확도가 급격히 떨어진다.
  • 추론에 더 많은 예산을 쓰더라도 정확도는 개선되지 않았다.
  • 교사 모델의 판단을 학생 모델로 증류해 훈련하면 학생이 보지 못한 작업에서 더 나은 결정을 내리고 SWE-bench Pro 작업의 최종 성공률을 향상시킨다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗