Qwen 3.8이 GPT-5.5 Pro의 추론 과정을 흡수했다

Key Point
오픈 소스 모델이 대형 상용 모델의 추론 방식을 얼마나 모사할 수 있는지, 특히 학습 데이터의 출처가 무엇인지 보여주는 분석이다.
핵심 요약
- GPT-5.5 Pro의 추론 시작 부분 1%를 다른 모델에 주입한 후 두 모델의 응답이 얼마나 유사한지 측정하는 실험을 진행했다.
- Qwen 3.8은 프리필 없을 때 16.79% 일치도에서 프리필 적용 시 34.97%로 +18.18 포인트 향상되어 가장 큰 변화를 보였다.
- Kimi K3는 GPT-5.5 Pro와의 기본 일치도가 31.11%로 가장 높지만 프리필의 추가 효과는 4.54 포인트에 불과했다.
- STEM 문제에서는 +26.99 포인트, 비STEM에서는 +12.80 포인트, 합성 퍼즐에서는 +14.75 포인트로 범주별로 다르게 나타났다.
- 분석 결과 Qwen이 이전 실험의 Opus와는 달리 GPT-5.5 Pro나 관련 GPT 모델에서 학습했을 가능성을 시사한다.