실패한 에이전트 50,000개로 배우는 오류 진단 데이터셋
Key Point
LLM 에이전트의 실패 경험을 체계적으로 수집하고 진단하는 대규모 데이터셋으로, 기존의 성공 사례만으로 학습하는 방식의 한계를 극복하고 오류 인식 학습을 가능하게 한다.
핵심 요약
- AI 에이전트의 실패 사례를 수집·분석하기 위해 9,961개 작업에서 나온 50,228개의 오류-진단 쌍으로 구성된 Agent Error Dataset(AED)을 제시한다.
- 33개 환경, 19개 하네스 패밀리, 23개 정책 모델에서 텍스트 기반 에이전트 시스템의 자연스러운 실패를 기록했으며, 원본 롤아웃을 반복하지 않고도 교차 환경 실패 분석이 가능하도록 소스 추적과 실행 메타데이터를 보존했다.
- 5단계 Agentic Error-to-Training(AET) 파이프라인으로 자연스러운 실패를 수집하고, 진단과 수정 방안을 생성한 후 기록된 증거와 대조하여 검증한다.