소프트웨어 개발을 돕는 AI 에이전트의 새 평가 벤치마크
Key Point
GUI 상호작용과 시각적 피드백을 함께 처리해야 하는 현실의 소프트웨어 개발 방식을 반영한 AI 에이전트 평가 체계가 처음 제시되어, 실무 수준의 자동화 개발 도구 발전에 기준점이 될 수 있다.
핵심 요약
- 소프트웨어 개발은 코드 편집을 넘어 소프트웨어 실행, 인터페이스 조작, 시각적 검사, 관찰 기반 판단까지 포함하지만 기존 코딩 에이전트들은 이 통합 개발 과정을 제대로 다루지 못하고 있다.
- 런타임 오류를 진단하려면 에이전트가 시각적 관찰과 코드를 연결한 후 응용 프로그램을 다시 실행해 수정사항을 검증해야 한다.
- CUA-SWE는 컴퓨터 사용 능력을 갖춘 AI 에이전트가 소프트웨어 엔지니어링 작업을 완수하는 방식을 평가하는 벤치마크, 환경, 평가 파이프라인이다.