사전학습 트랜스포머는 너무 일찍 멈춘다, 작은 LoRA로 해결
원제 Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
추천 55댓글 2
Key Point
미세 조정 기법만으로 트랜스포머의 숨겨진 추론 능력을 200배까지 끌어낼 수 있다는 발견으로, 효율적인 모델 개선 방법을 제시한다.
핵심 요약
- 사전학습된 트랜스포머들은 맥락 참조를 따르기 위해 모델의 깊이를 거의 활용하지 않으며, 13개 기본 모델은 평균 1.4~3.6줄의 체인만 따를 수 있다.
- 모든 모델 가중치를 고정한 상태에서 한 초기 계층에 rank-8 LoRA를 학습시키면 이 능력을 크게 확장할 수 있다.
- Qwen3-8B는 24줄 체인에서 정확도가 15.5%에서 99%로 개선되었고, 더 길게 학습된 LoRA는 50줄까지 도달했다.
- Qwen-1.4B는 4번 반복 후 60줄에, 8번 반복 후 최소 160줄까지 참조를 따를 수 있게 되었다.
- LoRA는 '릴레이'를 시작하는데, 프로그램 줄들이 체인 정체성을 중간층의 짧은 범위를 통해 전달하고, 고정된 헤드들이 체인을 따라 점진적으로 더 멀리 읽어낸다.
- 부모 줄 주의를 제거하면 이 릴레이가 중단되며, 마지막 유용한 개입 계층을 정량적으로 찾을 수 있다.
- MuSiQue 같은 다른 과제에서도 작업 특화 LoRA가 성능을 개선하며, 기본 모델이 활용 가능한 계산을 과소평가한다는 점을 시사한다.