Claude Opus 5.5의 성능 변화를 추적하는 벤치마크 공개
원제 Livenerf: Has Opus 5.5 been nerfed yet?
108 포인트댓글 62
Key Point
Claude 모델의 출시 후 성능 저하 의혹이 반복적으로 제기되는 상황에서, 데이터 기반 검증 도구가 공개돼 사용자와 개발자가 실제 변화를 직접 확인할 수 있게 되었다.
핵심 요약
- Claude Opus 5.5 출시 직후부터 모델 성능이 몰래 하락하는지 검증하는 'livenerf' 벤치마크를 공개했다.
- GPQA Diamond, MMLU-Pro, 대회 수학 문제 2,336개를 선별해 때때로 정답률이 50~70% 범위에 떨어지는 78개 문항을 최종 패널로 구성했다.
- 매일 90개 샘플을 실행하되, 처음 10일간을 기준선으로 설정하고 이후 두 개 10일 구간에서 통계적으로 유의미한 변화를 감지한다.
- 양자화·모델 교체·노력 저하·라우팅 변경 등 의심되는 변화를 탐지하기 위해 프롬프트·CLI·채점자를 완전히 고정하고 정확히 같은 조건으로 반복한다.
- 노력 저하는 정확도 변화보다 토큰 수 감소에서 먼저 드러나므로(저노력: −62% 토큰, −8.3±4.5 정확도), 출력 토큰을 주요 신호로 모니터링한다.
- Opus 5 모델로 교체되는 경우는 현재 검증 데이터로는 구별 불가능하므로(−3.8±6.3 정확도), 10일 구간 수집으로 검출력을 높일 계획이다.
- 통제 그룹으로 Claude Opus 5를 매일 실행하되 두 모델 모두에서 변화가 보이면 하드웨어·플랫폼 문제로 판단한다.
- 사전 등록된 결정 규칙: 두 개 10일 구간 모두에서 99% 신뢰 구간이 0을 제외하고, 최소 3포인트 이상 변화하며, 통제 그룹에는 나타나지 않아야 한다.
- 설정 방법은 Python 3.11+, uv, Claude Code 로그인 필요하고, CLI 버전을 핀하며 주간 예산의 고정 비율만 사용해 일상 용도와 경합하지 않는다.
- 모든 프롬프트·응답·사용량·CLI 버전·깃 해시·테스크 메타데이터를 원시 로그로 보존하며, 질문 데이터는 GUID 카나리를 포함해 투명성을 확보한다.
- 현재 9월 24일부터 매일 실행 중(30일 계획)이고, 10월 24일경 첫 통계 결과가 나올 예정이다.