Hugging Face 논문AI · 머신러닝오늘의 주요

사전학습 트랜스포머는 너무 일찍 멈춘다, 작은 LoRA로 해결

원제 Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

추천 55댓글 2Zehao Jin, Ruixuan Deng, Junran Wang
Key Point

미세 조정 기법만으로 트랜스포머의 숨겨진 추론 능력을 200배까지 끌어낼 수 있다는 발견으로, 효율적인 모델 개선 방법을 제시한다.

핵심 요약

  • 사전학습된 트랜스포머들은 맥락 참조를 따르기 위해 모델의 깊이를 거의 활용하지 않으며, 13개 기본 모델은 평균 1.4~3.6줄의 체인만 따를 수 있다.
  • 모든 모델 가중치를 고정한 상태에서 한 초기 계층에 rank-8 LoRA를 학습시키면 이 능력을 크게 확장할 수 있다.
  • Qwen3-8B는 24줄 체인에서 정확도가 15.5%에서 99%로 개선되었고, 더 길게 학습된 LoRA는 50줄까지 도달했다.
  • Qwen-1.4B는 4번 반복 후 60줄에, 8번 반복 후 최소 160줄까지 참조를 따를 수 있게 되었다.
  • LoRA는 '릴레이'를 시작하는데, 프로그램 줄들이 체인 정체성을 중간층의 짧은 범위를 통해 전달하고, 고정된 헤드들이 체인을 따라 점진적으로 더 멀리 읽어낸다.
  • 부모 줄 주의를 제거하면 이 릴레이가 중단되며, 마지막 유용한 개입 계층을 정량적으로 찾을 수 있다.
  • MuSiQue 같은 다른 과제에서도 작업 특화 LoRA가 성능을 개선하며, 기본 모델이 활용 가능한 계산을 과소평가한다는 점을 시사한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗