Hugging Face 논문AI · 머신러닝오늘의 주요

실제 배포 데이터로 에이전트 테스트 벤치마크 자동 생성

원제 TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces

추천 29댓글 1Dehai Min, Daoan Zhang, Yiming Zeng 외
Key Point

실전 배포 데이터 252,557개에서 자동으로 테스트 벤치마크를 만드는 기법이 공개됐으며, 현재 최고 성능의 LLM들도 이 벤치마크에서 평균 26.7%의 낮은 통과율만 기록해 에이전트 시스템의 개선 과제를 명확히 한다.

핵심 요약

  • TraceDance는 실제 에이전트 배포 기록에서 문제 행동을 추출해 목표형 벤치마크를 자동 구축하는 시스템이다.
  • Anchor-and-Confirm 기법은 프로그래머블 검색과 Flash LLM의 후보 수준 확인을 조합해 효율적으로 벤치마크를 만든다.
  • Anchor Synthesis Loop는 사용자가 지정한 문제 행동에 대한 명세를 생성하고 반복적으로 개선한다.
  • 의사결정 지점 계속하기(decision-point continuation) 방식으로 참고 답이나 환경 재생 없이 LLM의 다음 응답을 평가한다.
  • 코딩과 도구 활용 두 영역에서 252,557개 세션으로부터 107개의 벤치마크와 4,125개 인스턴스를 생성했고, 요청의 95.3%를 충족했다.
  • 인간 평가자가 샘플링된 인스턴스의 84%에서 요청된 행동을 확인했으며, 자동 채점기의 정확성은 평가자 간 일치도와 비슷한 수준이다.
  • 9개 최신 LLM은 평균 26.7%의 통과율만 달성해 평가된 의사결정 지점에서 적절하게 대응하지 못함을 보인다.
  • 행동별 벤치마크 분석을 통해 현재 LLM 에이전트의 여러 약점을 드러냈으며, 배포 문제를 목표형 벤치마크로 전환해 재귀적 자가 개선(RSI) 루프의 핵심 요소로 활용할 수 있다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗