불확실한 성공은 강화, 확실한 실패는 교정하는 LLM 추론 방식
원제 Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning
추천 28댓글 1
Key Point
LLM이 복잡한 추론 과제를 풀 때 필요한 신용 할당에서 추가 모델 없이도 작동하는 더 효율적인 방법이 제시되어, 강화학습 기반 LLM 개선의 실용성을 높인다.
핵심 요약
- LLM의 추론 능력을 강화하는 검증 가능한 보상 기반 강화학습(RLVR)에서 기존 신용 할당 방식들은 보조 모델이나 추가 샘플링, 특권 정보가 필요했다.
- 이 논문은 정책 엔트로피를 신호로 활용하되 성공과 실패를 비대칭으로 처리하는 Entropic Advantage Policy Optimization(EAPO)을 제안한다.
- EAPO의 핵심 아이디어는 불확실한 상황에서의 성공은 반복성이 낮고 확실한 실패는 되풀이되는 경향에서 비롯되었다.
- 높은 엔트로피 결정이 포함된 성공 응답은 강화, 낮은 엔트로피 결정이 포함된 실패 응답은 페널티를 주되, 불확실한 위치에선 페널티를 약화해 탐색 기회를 보존한다.
- 기존 롤아웃 신호만 사용해 추가 감독 없이 토큰 수준의 신용을 도출한다.
- 다양한 추론 작업과 기본·추론 백본 모두에서 검증했을 때 EAPO가 최고 성능을 달성했다.
- 효과적인 탐색을 촉진해 더 많은 문제를 다루고 더 다양한 후보 답변을 생성한다.