루브릭 기반 강화학습의 보상 문제 해결하는 MetaRubric
원제 MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
추천 11댓글 1
Key Point
AI 모델의 보상 신호 설계 방식에 근본적인 문제점을 지적하고 의료·과학 분야 QA 성능을 20% 이상 끌어올린 접근법으로, 강화학습 기반 모델 개발에 실질적인 개선 방법을 제시한다.
핵심 요약
- 루브릭 기반 강화학습은 개별 응답 요구사항에 부분 점수를 할당해 개방형 과제를 최적화하지만, 루브릭 판정자가 필수 정보나 행동이 없어도 높은 점수를 주는 '공허한 신용(Vacuous Credit)' 문제가 발생한다.
- 이 문제는 필수 정보가 제거된 후에도 지속되며 응답의 GRPO 우위 부호를 역전시킬 수 있다.
- MetaRubric은 증거 인식 정책 최적화와 응답 기반 루브릭 적응을 교대로 수행하는 방식으로 이를 해결한다.
- 각 프롬프트에서 과제 관련 사실 하나를 변경해 반사실적 대조쌍을 생성한다.
- 정책 최적화 단계에서는 응답이 루브릭 기준을 만족할 충분한 증거를 포함할 때만 신용을 할당한다.
- 각 정책 최적화 단계 후 현재 정책 응답이 원본 및 반사실적 기준 개정을 안내하되, 프롬프트 사실에 따라 해석된 원본 루브릭의 의미는 보존한다.
- 단계 경계에서 기준 가중치를 적응시켜 관찰된 정책 오류를 더 잘 처리한다.
- 여러 모델 백본에서 MetaRubric은 정적 판정자 GRPO 대비 PubMedQA 정확도를 6.00~20.40 백분포인트 개선하며, HealthBench-Hard와 두 가지 멀티모달 의료 벤치마크에서 추가 성능 향상을 달성한다.