엔터프라이즈 데이터 작업 평가 벤치마크 'Argo-Bench' 공개
원제 Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
추천 18댓글 2
Key Point
엔터프라이즈 규모 데이터 시스템에서 AI가 쿼리 작성을 넘어 실제 의사결정까지 할 수 있는지 평가하는 첫 벤치마크이며, 현재 최강 모델도 35% 미만의 성공률로 데이터 에이전트의 현주소를 보여준다.
핵심 요약
- 기존 text-to-SQL 벤치마크는 쿼리 생성만 평가하며 정답 오류도 빈번한데, 실제 엔터프라이즈 데이터 환경은 수십 개 테이블을 넘나들며 통계 분석과 실행 가능한 의사결정을 요구한다.
- Argo-Bench는 뉴욕시 음식배달 플랫폼을 원탁 규모(2024년 주문 8,100만 건)로 시뮬레이션하고 Oracle E-Business Suite 스키마를 따른 235개 테이블, 75억 행의 ERP 웨어하우스를 모델링했다.
- 210개 데이터 과학·분석 작업으로 구성되며, 에이전트는 웨어하우스를 탐색해 사실을 재구성한 뒤 부정행위자 계정 차단, 배송원 인센티브 예산 할당, 소급 급여 지급 같은 실제 액션을 취해야 한다.
- 모든 작업은 실행 가능한 참조 솔루션을 포함하며, 에이전트의 액션은 시뮬레이터 내 결과로 채점되므로 기존 벤치마크처럼 형식적 정답 비교에만 의존하지 않는다.
- 14개 최신 모델(대형 및 오픈소스 모두)을 평가한 결과, 가장 우수한 모델도 95점 이상은 34.8%에 불과하며 평균 59.5점에 그쳤다.
- Argo-Bench는 text-to-SQL을 넘어 실제 데이터 환경을 이해하고 탐색하며 행동할 수 있는 에이전트 개발을 촉진할 것을 목표로 한다.