Hugging Face 논문AI · 머신러닝

LLM 코딩 벤치마크, 실제 실력 평가 아닌 암기 성공 가능성

원제 Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?

추천 16댓글 2Silin Chen, Yufei Yang, Xiaodong Gu 외
Key Point

LLM 코딩 평가 벤치마크가 실제 실력이 아닌 암기된 패턴 재인식을 측정하고 있을 가능성을 실증적으로 보여, SWE-bench 성능 신뢰도 문제를 제기한다.

핵심 요약

  • SWE-bench 등 저장소 수준 코딩 벤치마크는 학습 데이터에 반복 사용된 인기 오픈소스 저장소 기반이라 데이터 유출 문제를 안고 있다.
  • 강한 성능이 실제 저장소 추론 능력이 아니라 표준화된 저장소 단서 암기를 반영할 가능성이 있다.
  • SchrodingerRepo 평가 프레임워크를 제안하며, 정적 저장소 표현 대신 평가 시점에 동적으로 인스턴스화된 저장소를 사용한다.
  • 문제 진술 재구성, 네임스페이스 재매핑, 파일 내 레이아웃 재정렬, 기능 보존 코드 재작성의 4단계를 통해 친숙한 단서를 제거하면서도 실행 동작은 보존한다.
  • SWE-bench Verified와 SWE-QA에서 LLM을 평가한 결과, 친숙한 저장소 단서 제거 시 모든 모델의 성능이 일관되게 하락했다.
  • 상호작용 비용도 상당히 증가했으며, 추가 비용은 주로 저장소 탐색과 위치 파악의 어려움 증가에서 비롯됐다.
  • 현재 코딩 에이전트가 저장소 측 단서에 부분적으로 의존할 수 있으며, 동적으로 인스턴스화된 저장소 표현 하에서의 평가 필요성을 제시한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗