Hugging Face 논문AI · 머신러닝

LLM 정렬을 위한 확산 기반 보상 모델 등장

원제 Diffusion Reward Models

추천 22댓글 1Xiangyang Wang, Bingxiang He, Zeyuan Liu 외
Key Point

인간의 다양한 판단 방식을 반영하는 새로운 보상 모델이 RLHF 학습에서 성능 개선을 직접 입증했기 때문에, LLM 정렬 연구에 실질적 영향을 미칠 수 있다.

핵심 요약

  • 기존 보상 모델은 각 프롬프트-응답 쌍을 단일 점 추정값이나 고정된 분포로 축소하지만, 인간 선호도는 본질적으로 다중모달이다—같은 응답이 여러 방식으로 합리적으로 평가될 수 있다.
  • 이를 해결하기 위해 Diffusion Reward Model(DRM)을 제안하며, 이는 보상 모델링을 조건부 밀도 추정 문제 p(r|x,y)로 재구성한다.
  • DRM은 동결된 LLM 인코더를 기반으로 경량 Diffusion Transformer가 가우시안 노이즈를 보상 벡터로 제거(denoising)하며, 출력 분포에 대한 매개변수 가정 없이 자연스럽게 다중모달 구조를 표현한다.
  • 단일 아키텍처로 다중 속성 회귀와 쌍 비교 데이터를 모두 처리하며, 추론 시 N개 샘플이 실증적 보상 분포를 형성해 스칼라, 분산 또는 분위수로 집계할 수 있다.
  • 5개 벤치마크에서 DRM은 동일 데이터와 백본 조건에서 기존 방법과 동등하거나 우수하며, 훨씬 큰 판별적·분포적·생성적 보상 모델들과 경쟁력 있는 성능을 보이면서도 훈련 규모는 적다.
  • 기존 방법들이 단일 점으로 붕괴하는 곳에서 DRM은 다중모달 보상 구조를 복구한다.
  • 불확실성 인식 거부와 하한 집계(LCB) 같은 기법으로 DRM이 스칼라 보상 이상의 분포 정보를 활용해 보상 모델 의사결정을 개선함을 보인다.
  • RLHF 실험에서 DRM을 훈련 시간 보상으로 사용하면 정책 성능이 향상되며, 이는 확산 기반 보상 모델의 실질적 이점을 직접 검증한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗