최신 언어 모델의 숨겨진 사고 과정 추출 및 분석
원제 Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
추천 15댓글 2
Key Point
폐쇄형 모델의 내부 추론 메커니즘이 어떻게 동작하는지 처음 체계적으로 들여다본 연구로, 모델의 성능 향상이 실제 추론 능력 증대인지 판단할 수 있는 근거를 제시한다.
핵심 요약
- 최신형 언어 모델의 성능 향상이 추론 능력 개선 때문인지 검증하려면, 폐쇄형 시스템의 CoT(Chain-of-Thought) 추적을 관찰해야 하는데 현재 접근 불가능하다.
- 연구팀은 표준 API의 커스텀 도구 등록 기능을 이용해 GPT-4o Astra 등 최신 모델들이 중간 추론 과정을 외부화하도록 유도했다.
- 추출된 추론을 오픈소스 모델의 기본 CoT와 비교해 진정한 추론인지 사후 정당화인지 검증하고, 경쟁 수학·과학·코드 생성 작업에서 평가했다.
- 추출된 추론은 기본 CoT 성능과 일치하며, 추론 없는 기준 모델을 크게 능가했다.
- 최신 모델들이 토큰 효율성, 추론 단계 유형, 추론 트리 구조에서 어떻게 다르게 중간 추론을 외부화·압축·조직화하는지 특성을 파악했다.
- Astra는 토큰 효율적인 방향성 추론을 보여주며 정답 궤적을 더 빨리 선택하고, 기초 단계는 내부에서 처리하며 중요 추론만 외부화했다.
- 이런 발견은 벤치마크 점수를 넘어 최신 모델의 추론 방식을 행동적으로 관찰하는 관점을 제공한다.