문맥 학습의 약점을 공개 문서 합성으로 보완
원제 Learning to Learn from Context: Synthetic Training from Perturbed Public Documents
추천 24댓글 1
Key Point
대규모 언어 모델의 문맥 학습 능력을 사람 개입 없이 개선하는 확장 가능한 방법이 제시되어, 고비용 데이터 레이블링에 의존하던 관행을 바꿀 수 있다.
핵심 요약
- LLM이 작업별 문맥을 이해하고 학습하는 능력이 약한데, 사람이 주석을 달아서 훈련 데이터를 만드는 것은 비용이 많이 들고 확장하기 어렵다.
- 공개 문서는 풍부한 자원이지만 대부분 사전학습에 이미 포함돼 있어서, 그대로 학습하면 문맥 학습보다 암기를 유도할 수 있다.
- 연구팀은 공개 문서를 약간씩 수정한 뒤 3.5k개 문서에서 사람의 개입 없이 약 10k개 샘플을 자동 생성하는 파이프라인을 구축했다.
- 파이프라인은 (1) 문서 재작성으로 암기 위험 감소, (2) 문서 기반 추론 질문·평가 기준 생성, (3) 문맥으로 질문 답변, (4) 문서에 진정으로 의존하는 샘플만 필터링한다.
- 학생 모델(Qwen3.6-35B-A3B)을 감독 미세조정(SFT)하면 CL-bench에서 13.7%에서 22.8%로 상승했다.
- 그 다음 보상 모델 강화학습(RL) 단계를 거치면 24.6%에 도달해, 1조 개 이상의 파라미터를 가진 Qwen3.8-2.4T(23.9%)와 비슷한 수준이다.
- 향상 효과는 긴-문맥 이해, 명령어 따르기, 추론으로 광범위하게 전이되는 반면, 코드 생성과 지식 영역은 거의 변화 없었다.
- 연구팀은 이 접근법이 사람 주석 없이 LLM의 문맥 학습 능력을 개선하는 재현 가능하고 확장 가능한 방법을 제공한다고 설명했다.