Hugging Face 논문AI · 머신러닝

강화학습으로 LLM의 추론능력 높이는 BPO 알고리즘 제안

원제 Bellman Policy Optimization

추천 37댓글 3Zhuoqing Song, Haotian Xu, Xikun Zhang 외
Key Point

LLM의 수학 추론 같은 복잡한 작업 개선에 필요한 새로운 학습 알고리즘으로, 기존보다 계산 효율적인 방법을 제시한다.

핵심 요약

  • 검증 가능한 보상을 활용한 강화학습(RLVR)으로 LLM의 추론 성능을 향상시키는 Bellman Policy Optimization(BPO)을 제안했다.
  • Policy Mirror Descent(PMD)에서 유도한 비평가 불필요(critic-free) 방식으로, 벨만 방정식을 이용해 중간 상태의 값 추정을 피한다.
  • 원래 PMD 목적함수와 동일한 유일한 최적해를 갖도록 증명했고, 손실함수는 보완적 토큰 확률의 평활 비율을 가중치로 사용한다.
  • 수학 추론 벤치마크에서 BPO의 효과를 실험으로 검증했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗