문항반응이론으로 루브릭 보상 설계
원제 Rubric Rewards from Item Response Theory
추천 10댓글 1
Key Point
강화학습에서 복합적인 평가 기준을 다룰 때 더 효율적이고 차별화된 보상 신호를 만드는 새로운 이론 및 실제 방법론을 제시한다.
핵심 요약
- 언어 작업은 자동 검증이 어려워 여러 기준으로 평가하는 루브릭을 사용하는데, 기존 방식은 기준별 점수를 단순합산한다.
- 단순합산은 다른 평가 패턴이 같은 보상을 받고, 각 기준의 중요도를 고정값으로 인코딩해 판별력을 반영하지 못한다.
- 강화학습에서 평가 기준이 증가하면 판정자 요청이 선형으로 늘어나는 한계도 있다.
- 논문은 루브릭 응답이론(RRT)을 제안해 루브릭 기준들을 공유 목표를 향한 단조지시자로 보고 이를 기반으로 품질을 측정한다.
- RRT는 이항반응모형을 사용해 평가 패턴을 품질에 대한 증거로 해석하고, 우도 점수가 품질에 대한 신호대잡음비를 최대화한다.
- 응답매개변수네트워크(RPN)는 프롬프트와 기준 텍스트를 읽어 기준의 난이도와 판별력을 예측한다.
- 훈련 중 정책 분포가 변할 때 RRT는 온라인 기댓값최대화로 현재 롤아웃 평가로부터 RPN을 갱신한다.
- Qwen3.5-4B 정책에서 의학·과학·루브릭 보상·RubricBench 등 4개 데이터셋의 매크로 기준 점수가 GRPO 대비 1.7점 높았다.
- 의학·과학의 어려운 기준에서는 GRPO 대비 2.8~5.6점 향상되었다.
- 절반의 기준 예산으로 적응적 피셔 선택을 사용하면 RPN을 고정하고도 전체 판정 시 GRPO와 0.1점 이내의 성능을 유지한다.
- 이는 RRT가 판정자 요청을 줄이면서 경쟁력 있는 성능을 유지할 수 있음을 보여준다.