Hugging Face 논문AI · 머신러닝

토큰 단위 신용할당 원리로 LLM 강화학습 개선

원제 PACT: From Credit Assignment to Critic Alignment

추천 16댓글 3Jiayan Fu, Hang Xu, Yong Zhang 외
Key Point

토큰 단위 신용할당의 수학적 정의를 처음 엄밀하게 규정하고, 이를 바탕으로 LLM 강화학습의 핵심 알고리즘들을 통일된 틀에서 설명하며, 실제 수학·소프트웨어 문제에서 기존 방법들을 크게 능가하는 구체적 성과를 냈다.

핵심 요약

  • 강화학습 기반 LLM 후처리 훈련에서 토큰 단위 신용할당(credit assignment)의 수학적 정의가 명확하지 않아, 기존 훈련 신호들과의 관계가 불분명했다.
  • Completeness, Prefix Consistency, Neutrality 세 가지 정칙성 조건을 제시하면 토큰 단위 신용할당이 유일하게 결정됨을 증명했다.
  • 이 특성화를 통해 On-Policy Distillation(OPD)의 이상적 교사가 암묵적 비평가 역할을 하며, Response-level REINFORCE Leave-One-Out(RLOO)이 토큰 단위 신용할당과 일치하는 정책 기울기를 낸다는 것을 확인했다.
  • Generalized Advantage Estimation(GAE)에서 중간 비평가 오류가 기저 신용과 비교 가능할 수 있음을 보였다.
  • 이를 바탕으로 Policy Aligned Critic Training(PACT)를 제안하는데, Actor-then-Critic 순서로 업데이트하고 중요도 샘플링 보정을 적용해 비평가를 업데이트된 정책과 더 잘 정렬시킨다.
  • 수학적 추론 벤치마크 4개에서 PACT는 평균 정확도 72.87%로 GRPO보다 8.80 퍼센트포인트, PPO보다 13.16 퍼센트포인트 높았다.
  • SWE-bench Verified에서는 통과율 67.4%로 PPO(2.4pp 차이), GRPO(2.0pp 차이), SAO(3.8pp 차이)를 초과했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗