루프형 트랜스포머의 추론 효율 50% 끌어올리는 LoopCD
원제 Decoding Looped Transformers Better for (Almost) Free
추천 19댓글 2
Key Point
루프형 트랜스포머는 추론 효율을 중시하는 모바일·엣지 환경에서 주목받는데, LoopCD로 추론 계산량을 절반 가까이 줄이면서 정확도도 높일 수 있다는 것이 중요하다.
핵심 요약
- 루프형 트랜스포머는 재귀 루프 내에서 공유 블록을 반복 실행해 매개변수 효율을 높이지만, 각 루프마다 생성되는 중간 표현은 표준 디코딩에서 버려진다.
- 강한 예측과 약한 예측을 자동으로 쌍으로 제공하는 루프의 특성을 활용하면, 보조 모델이나 외부 학습 없이 디코딩을 개선할 수 있다.
- 연구진은 훈련 없는 대비학습 프레임워크 LoopCD를 제안했으며, 최종 예측을 이전 루프와 비교해 토큰 선택을 안내한다.
- LoopCD-Logits는 로짓 공간에서 한 번의 추가 출력으로 동작하고, LoopCD-Hidden은 숨겨진 상태 공간에서 추가 비용 없이 동작한다.
- Ouro-2.6B-Thinking의 AIME 2024 pass@1은 61.88%에서 73.33%로 올랐고, Huginn의 HumanEval pass@1은 22.56%에서 31.71%로 상승했다.
- LoopCD를 사용하면 전체 깊이에서 동일하거나 더 나은 성능을 유지하면서 재귀 루프 개수를 절반으로 줄일 수 있다.
- 순방향 FLOPs를 22.5%에서 48.2% 감소시키면서도 디코딩 품질은 향상되므로, 중간 재귀 상태를 효과적인 안내 신호로 변환했다.