AI 코딩 에이전트, 여러 저장소 간 조율된 변경 가능한가
원제 WideSWE: Can Coding Agents Coordinate Changes Across Repositories?
추천 16댓글 2
Key Point
AI 코딩 에이전트가 현실의 복잡한 소프트웨어 생태계 작업(여러 저장소 간 조율된 변경)을 얼마나 처리할 수 있는지 처음으로 체계적으로 측정한 벤치마크를 제시하기 때문이다.
핵심 요약
- 코딩 에이전트의 평가가 단일 저장소 내 문제 해결을 넘어 장기적 개발 작업으로 진화하는 가운데, 현실의 소프트웨어 생태계에서는 여러 저장소 간 조율된 변경이 필요한 경우가 많다.
- WideSWE 벤치마크는 코딩 에이전트가 여러 저장소를 거쳐 수행하는 작업을 평가하도록 설계했다.
- 103개 소프트웨어 생태계에서 수집한 실제 작업은 총 120개이며, 버그 수정 60개와 기능 추가 60개로 균형을 맞췄다.
- 관련 이슈와 풀 리퀘스트에서 파생된 프롬프트를 사용하고, 다양한 올바른 구현을 지원하면서도 필수 동작과 회귀 검사는 보존하도록 숨겨진 테스트를 조정했다.
- 7가지 에이전트 구성에서 전체 작업 완료율은 10.83%~42.50% 범위이며, Codex CLI과 GPT-5.6-sol을 조합한 구성이 최고 성능을 달성했다.
- 실패 분석 결과 에이전트들은 필요한 변경을 식별하지 못하거나, 변경을 인식하면서도 미완료 상태로 두거나, 요청을 완전히 만족하지 못한 채 저장소를 수정하는 패턴을 보였다.
- 한 저장소씩 순차 실행 방식을 동일 프롬프트로 비교했을 때, 순차 실행은 주로 생략된 작업을 복구하고 이전 실패한 구현을 교정하는 데는 효과가 낮았다.
- 반면 통합 실행은 관련 저장소의 정보를 활용해 구현과 검증을 안내할 수 있었다.