Hugging Face 논문AI · 머신러닝

불확실한 성공은 강화, 확실한 실패는 교정하는 LLM 추론 방식

원제 Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning

추천 28댓글 1Woongyeong Yeo, Minki Kang, Chanuk Lee 외
Key Point

LLM이 복잡한 추론 과제를 풀 때 필요한 신용 할당에서 추가 모델 없이도 작동하는 더 효율적인 방법이 제시되어, 강화학습 기반 LLM 개선의 실용성을 높인다.

핵심 요약

  • LLM의 추론 능력을 강화하는 검증 가능한 보상 기반 강화학습(RLVR)에서 기존 신용 할당 방식들은 보조 모델이나 추가 샘플링, 특권 정보가 필요했다.
  • 이 논문은 정책 엔트로피를 신호로 활용하되 성공과 실패를 비대칭으로 처리하는 Entropic Advantage Policy Optimization(EAPO)을 제안한다.
  • EAPO의 핵심 아이디어는 불확실한 상황에서의 성공은 반복성이 낮고 확실한 실패는 되풀이되는 경향에서 비롯되었다.
  • 높은 엔트로피 결정이 포함된 성공 응답은 강화, 낮은 엔트로피 결정이 포함된 실패 응답은 페널티를 주되, 불확실한 위치에선 페널티를 약화해 탐색 기회를 보존한다.
  • 기존 롤아웃 신호만 사용해 추가 감독 없이 토큰 수준의 신용을 도출한다.
  • 다양한 추론 작업과 기본·추론 백본 모두에서 검증했을 때 EAPO가 최고 성능을 달성했다.
  • 효과적인 탐색을 촉진해 더 많은 문제를 다루고 더 다양한 후보 답변을 생성한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗