LLM 정렬을 위한 확산 기반 보상 모델 등장
원제 Diffusion Reward Models
추천 22댓글 1
Key Point
인간의 다양한 판단 방식을 반영하는 새로운 보상 모델이 RLHF 학습에서 성능 개선을 직접 입증했기 때문에, LLM 정렬 연구에 실질적 영향을 미칠 수 있다.
핵심 요약
- 기존 보상 모델은 각 프롬프트-응답 쌍을 단일 점 추정값이나 고정된 분포로 축소하지만, 인간 선호도는 본질적으로 다중모달이다—같은 응답이 여러 방식으로 합리적으로 평가될 수 있다.
- 이를 해결하기 위해 Diffusion Reward Model(DRM)을 제안하며, 이는 보상 모델링을 조건부 밀도 추정 문제 p(r|x,y)로 재구성한다.
- DRM은 동결된 LLM 인코더를 기반으로 경량 Diffusion Transformer가 가우시안 노이즈를 보상 벡터로 제거(denoising)하며, 출력 분포에 대한 매개변수 가정 없이 자연스럽게 다중모달 구조를 표현한다.
- 단일 아키텍처로 다중 속성 회귀와 쌍 비교 데이터를 모두 처리하며, 추론 시 N개 샘플이 실증적 보상 분포를 형성해 스칼라, 분산 또는 분위수로 집계할 수 있다.
- 5개 벤치마크에서 DRM은 동일 데이터와 백본 조건에서 기존 방법과 동등하거나 우수하며, 훨씬 큰 판별적·분포적·생성적 보상 모델들과 경쟁력 있는 성능을 보이면서도 훈련 규모는 적다.
- 기존 방법들이 단일 점으로 붕괴하는 곳에서 DRM은 다중모달 보상 구조를 복구한다.
- 불확실성 인식 거부와 하한 집계(LCB) 같은 기법으로 DRM이 스칼라 보상 이상의 분포 정보를 활용해 보상 모델 의사결정을 개선함을 보인다.
- RLHF 실험에서 DRM을 훈련 시간 보상으로 사용하면 정책 성능이 향상되며, 이는 확산 기반 보상 모델의 실질적 이점을 직접 검증한다.