LLM이 코드를 학습했을까, 암기했을까?
Key Point
코딩 벤치마크의 신뢰성 문제를 실증적으로 검증한 연구로, LLM 기반 소프트웨어 엔지니어링 도구의 실제 능력이 얼마나 과대평가되고 있는지 보여준다.
핵심 요약
- 저장소 레벨 코딩 벤치마크는 훈련에 사용된 오픈소스 저장소를 반복 사용해 데이터 누수가 발생하고, 성능이 실제 추론 능력보다 암기를 반영할 수 있다.
- SchrodingerRepo 평가 프레임워크는 테스트 시점에 저장소를 동적으로 변환해 이름 규칙·파일 구조·구현 패턴 같은 익숙한 단서를 제거한다.
- SWE-bench Verified와 SWE-QA에서 저장소 단서를 제거하면 모든 LLM의 성능이 일관되게 저하되고, 상호작용 비용은 크게 증가한다.
- 추가 비용의 주원인은 저장소 탐색과 위치 파악의 어려움이며, 현재 코딩 에이전트가 저장소 단서에 부분적으로 의존하고 있음을 시사한다.