Hugging Face 논문AI · 머신러닝

강화학습으로 LLM 정책 증류 효율성 높이기

원제 An RL View of OPD: Least Square Policy Distillation for Sample-Efficient LLM Reasoning

추천 10댓글 2Shangzhe Li, Yuxiao Yang, Tianrun Yu 외
Key Point

LLM 정책 증류의 표본 효율성을 강화학습 이론으로 획기적으로 개선한 방법론으로, 수학 추론 등 복잡한 작업에서 필요한 롤아웃을 대폭 줄일 수 있다.

핵심 요약

  • 논문은 정책 증류(OPD)를 강화학습 관점으로 분석해 역KL 목적함수와 KL정규화 정책 최적화의 연결성을 규명했다.
  • 이를 바탕으로 최소제곱 정책 증류(LSPD) 프레임워크를 제안했으며, 값 기반 RL의 낙관적 탐색과 오프정책 데이터 재사용을 결합했다.
  • LSPD는 탐색 중 정책 다양성을 유지하면서도 이전에 수집한 궤적을 반복 학습해 롤아웃 효율성을 개선한다.
  • 이론적 분석에서 LSPD는 온라인 탐색 시 O(log K) 후회 한계를 달성하는 낙관적 값 기반 학습과 연결된다.
  • 수학 추론 벤치마크 6개에서 기존 증류 방법 대비 평균 1.59점 향상(Avg@16)을 보였으며, Pass@64까지의 평가에서 정책 다양성을 더 잘 보존했다.
  • 완전 오프정책 버전은 표준 OPD와 비슷한 성능을 롤아웃 배치의 첫 25% 데이터만으로 달성했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗