LLM의 자기 설명은 사실이 아니다, 채팅 템플릿이 결정한다

Key Point
LLM이 자신을 설명하는 방식이 실제로 무엇을 의미하는지가 불분명했는데, 이 연구는 채팅 템플릿이 모든 것을 결정한다는 구체적 증거를 제시해 AI 안전성 논의와 모델 평가 방식에 직접적 영향을 미친다.
핵심 요약
- LLM이 자신을 "단순한 AI일 뿐"이라 설명하는 이유를 연구한 논문이 arXiv에 공개됐다.
- 9B 파라미터까지의 8개 오픈소스 모델을 분석한 결과, 채팅 템플릿이 LLM의 자기 설명 방식을 근본적으로 바꾸는 '스위치' 역할을 한다는 것을 발견했다.
- 채팅 템플릿이 있으면 '나는 AI입니다' 같은 부인 표현은 증가하고, '나는 느낀다' 같은 경험 표현은 감소한다.