트랜스포머의 선형 중첩: 서로 다른 텍스트를 동시에 처리한다
원제 Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
추천 20댓글 1
Key Point
LLM이 내부적으로 여러 의미를 동시에 처리하는 선형적 구조를 가진다는 발견은 모델의 동작 방식에 대한 근본적인 이해를 바꾸며, 하나의 추론으로 여러 결과를 생성하는 효율성 개선까지 가능하게 한다.
핵심 요약
- LLM이 비선형 구성요소에 의존하지만, 서로 다른 텍스트 스트림의 입력을 선형 결합하면 모델이 개별 다음 토큰 분포의 중첩을 출력하는 '중첩 선형성 가설'을 발견했다.
- 이 중첩 현상은 트랜스포머 아키텍처의 고유한 특성이며, 학습 과정 중에 오히려 감소하는 경향을 보였다.
- 경량 파인튜닝을 통해 선형성을 상당히 복원할 수 있으며, 예측된 다음 토큰 분포와 개별 분포의 평균 간 차이를 크게 줄일 수 있다.
- 새로운 가이드 디코딩 절차를 도입해 중첩된 출력을 분리하면, 단일 순전파에서 두 개의 일관된 텍스트 연속을 동시에 생성할 수 있다.