실패한 에이전트 50,000개로 배우는 오류 진단 데이터셋
원제 Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training
추천 45댓글 2
Key Point
LLM 에이전트의 실패 경험을 체계적으로 수집하고 진단하는 대규모 데이터셋으로, 기존의 성공 사례만으로 학습하는 방식의 한계를 극복하고 오류 인식 학습을 가능하게 한다.
핵심 요약
- AI 에이전트의 실패 사례를 수집·분석하기 위해 9,961개 작업에서 나온 50,228개의 오류-진단 쌍으로 구성된 Agent Error Dataset(AED)을 제시한다.
- 33개 환경, 19개 하네스 패밀리, 23개 정책 모델에서 텍스트 기반 에이전트 시스템의 자연스러운 실패를 기록했으며, 원본 롤아웃을 반복하지 않고도 교차 환경 실패 분석이 가능하도록 소스 추적과 실행 메타데이터를 보존했다.
- 5단계 Agentic Error-to-Training(AET) 파이프라인으로 자연스러운 실패를 수집하고, 진단과 수정 방안을 생성한 후 기록된 증거와 대조하여 검증한다.
- 리플레이를 지원하는 3,062개의 대응 쌍에서 첫 번째 제안된 수정이 검증자 통과율을 18.4%에서 51.1%로 올려 32.7 포인트의 이득을 얻었다.
- 별도로 동결된 진단 릴리스를 사용하여 1,656개 소스 작업에 대해 전체 진단 미세 조정을 수행했을 때, Qwen3-8B의 정확한 단계 일치도가 내부 교사 라벨과 비교하여 47.2%에서 63.6%로 상승했다(943개 홀드아웃 케이스에서 3회 시드 평균).
- 가장 강력한 프롬프트 기준선이 54.7%를 기록했으며, 4가지 증가하는 훈련 세트 크기 모두에서 평균 일치도가 개선되었다.
- 액터 훈련 레시피의 단일 시드 비교에서 동작 전용 수정 훈련이 WebShop-lite에서 성공 전용 훈련보다 6.67 포인트 높은 성과를 기록했다.