ML 에이전트는 왜 벤치마크에 오버피팅되지 않을까

Key Point
벤치마크 기반 ML 연구가 실제로 진전을 이루는 이유를 처음으로 실험적으로 검증한 연구로, 정보 압축성이 오버피팅을 방지하는 메커니즘을 밝혔다.
핵심 요약
- 반복적인 벤치마크 평가에도 불구하고 ML 모델이 오버피팅되지 않는 현상을 Amazon Science 연구진이 설명했다.
- 성공적인 ML 에이전트의 전략은 매우 압축 가능하며, 16개 토큰 수준으로 축약해도 새 에이전트가 원래 성능을 재현할 수 있다는 점에서 데이터 암기가 아닌 실제 구조를 학습함을 보여준다.
- 진정한 오버피팅 전략은 정보 병목을 통과하면 벤치마크 성과가 사라진다는 압축 테스트로 진단할 수 있다.
- LLM은 강력한 압축 디코더로서 전문가 단축 프롬프트로부터 전체 ML 파이프라인을 재구성할 수 있으며, 이는 이들의 뛰어난 성능을 설명하는 구체적 방식이다.
- 오캄의 면도날을 수학적으로 형식화하면, 데이터 암기보다 훨씬 적은 비트로 표현 가능한 가설은 새 데이터에서도 잘 작동해야 한다.