LLM 강화학습의 '매튜 효과' 문제 진단 및 해결책 제시
Key Point
RL 기반 LLM 학습에서 성능 지표가 상승해도 실제로는 어려운 문제 해결 능력은 거의 개선되지 않는 숨은 편향을 공개하고, 계산 효율성을 통해 이 문제를 해결하는 방향을 제안하는 실증 연구이기 때문입니다.
핵심 요약
- LLM 강화학습 평가에서 평균 성능 향상이 쉬운 문제 개선에만 치우치고 어려운 문제는 거의 개선되지 않는 '매튜 효과'가 발생한다.
- 수학, 코딩, 에이전트 작업 등 여러 도메인에서 RL이 초기 성능이 좋은 작업일수록 개선폭이 크고, 원래 풀지 못하던 문제는 개선되지 않는 현상이 반복되었다.
- 더 많은 샘플링(k 값 증가)이 어려운 문제의 드문 정답은 찾지만, 동시에 쉬운 문제의 드문 오답도 증가시켜 학습 효율을 악화시킨다.
- 작은 k값(k=4)이 큰 k값(k=32)보다 어려운 문제 해결에 효과적임을 실험으로 확인했으며, 이는 학습 배치에서 쉬운 문제에 소비되는 계산량을 줄일 때 더 많은 리소스를 어려운 문제에 할당할 수 있기 때문이다.