LLM 강화학습의 신용 할당 문제, 수학적으로 정의하다
Key Point
LLM 강화학습의 핵심인 신용 할당을 수학적으로 정의함으로써 기존 알고리즘들의 동작 원리를 통일된 관점에서 설명할 수 있게 되었고, 이를 기반으로 한 PACT 방법론이 주요 벤치마크에서 현저한 성능 향상을 보여준다.
핵심 요약
- 강화학습 기반 LLM 학습에서 토큰 수준의 신용 할당이 명확한 수학적 정의가 없다는 문제를 지적했다.
- 완전성·접두사 일관성·중립성이라는 세 가지 규칙 조건으로 토큰 수준 신용을 유일하게 결정할 수 있음을 증명했다.
- 이 정의를 바탕으로 On-Policy Distillation의 교사는 암시적 비평가 역할을 한다는 점과 Response-level RLOO가 토큰 수준 신용과 동일한 정책 그래디언트를 만든다는 점을 보였다.
- 이를 토대로 Policy Aligned Critic Training(PACT)을 제안했으며, 액터 먼저 업데이트 후 비평가를 업데이트하고 중요도 샘플링 보정을 적용한다.
- 수학 추론 벤치마크에서 PACT는 평균 72.87% 정확도로 GRPO보다 8.8p, PPO보다 13.16p 높았고, SWE-bench에서 67.4% 통과율로 PPO·GRPO·SAO를 각각 2.4~3.8p 앞섰다.