소프트웨어 엔지니어링 AI, 작업 유형별 균형잡힌 학습으로 성능 향상
Key Point
소프트웨어 개발 작업의 다양한 유형별 난제를 동시에 해결하는 새로운 멀티에이전트 학습 방식이 기존보다 눈에 띄게 성능을 개선했습니다.
핵심 요약
- 저장소 수준의 소프트웨어 개발 작업은 카테고리마다 다양해서, 강화학습 중 일부 카테고리는 개선되고 다른 카테고리는 악화되는 불균형 문제가 있다.
- 연구팀은 카테고리별 전문 에이전트를 학습하고 이를 하나의 모델로 통합하는 프레임워크를 개발했다.
- 각 카테고리 전문가는 강화학습과 자기 검증 궤적 재활용, 작업 재선택을 반복하는 RRE(Refresh-Repair-Expand) 방식을 사용한다.
- 여러 전문가 모델을 다중 교사 지식 증류로 하나의 학생 모델로 통합하며, ReLU 게이트를 통해 각 교사의 개선 방향만 선택적으로 학습한다.
- 최종 모델은 Pro-618 벤치에서 58.04%, SWE-bench Multilingual에서 59.00% 해결률을 달성해 기본 모델 대비 각각 5.39, 2.78 포인트 향상했다.