작은 모델도 강력하게: 필요할 때만 큰 모델에 묻는 추론 시스템
원제 Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge
추천 31댓글 1
Key Point
작은 모델이 큰 모델과 비슷하거나 나은 성능을 훨씬 낮은 비용으로 달성하는 방법을 보여주므로, 프로덕션 추론 비용 최적화를 고민하는 개발팀에게 직접적인 영향이 있다.
핵심 요약
- 작은 추론 모델(sRM)의 테스트 타임 컴퓨팅을 확장하는 것이 성능 향상의 핵심이지만, 더 많은 사고가 항상 도움이 되는지는 명확하지 않다.
- 중간 추론 상태에 개입하는 실험을 통해 자기개선(self-refinement)이 기존에 도달 가능한 해답으로 확률질량을 집중시킬 뿐, 새로운 해답을 만들지는 못한다는 것을 발견했다.
- 두 가지 실패 양식을 식별했다: 올바른 경로는 도달 가능하지만 실행에 실패하는 실행 병목(execution bottleneck)과, 외부 정보가 필요한 지식 병목(knowledge bottleneck)이다.
- 이를 바탕으로 FlyBy 프레임워크를 제안했으며, 4B와 8B 모델 변형이 먼저 추론한 후 미해결 문제를 진단하고, 지식 병목에서 더 강력한 모델에 선택적으로 쿼리한다.
- 지도 학습으로 다중 깊이 쿼리 액션을 학습시키고, 비용 인식 강화학습으로 쿼리 여부·내용·예산을 최적화한다.
- 6개 벤치마크의 1,158개 어려운 문제에서 FlyBy-4B는 pass@8 45.96%를 달성해 Qwen3-14B(41.64%)를 2.7배 낮은 서빙 비용으로 초과했고, pass@1에서도 Qwen3-8B(15.31%)를 능가했다(16.85%).
- FlyBy-8B로 확장하면 pass@8이 51.81%까지 개선된다.