Hugging Face 논문AI · 머신러닝

동영상 생성 AI 학습, 평가기준 정해서 최적화

원제 RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

추천 19댓글 1Zhenchen Tang, Yang Li, Songlin Yang 외
Key Point

동영상 생성 모델의 품질 평가 방식을 개선함으로써 강화학습 기반의 동영상 생성 최적화 성능을 크게 향상시킬 수 있습니다.

핵심 요약

  • 동영상 생성 모델을 강화학습으로 최적화할 때 필요한 보상 모델이 불안정한 문제를 해결합니다.
  • 기존 방식은 동영상 품질을 숫자 하나로 바로 매겨서 평가기준이 명확하지 않았고, 프롬프트마다 점수 척도가 뒤흔들리는 '스칼라 드리프트' 문제가 있었습니다.
  • RewardVerse는 인간 평가 방식을 모방해 먼저 평가기준(루브릭)을 명시적으로 생성한 뒤, 그 기준에 따라 점수를 매기는 방식으로 안정성을 높입니다.
  • RGPO(루브릭 기반 정책 최적화)라는 2단계 훈련 알고리즘으로 루브릭 생성기와 평가기를 함께 최적화하며, 인간 평가와 계속 맞춰갑니다.
  • EvalVerse 벤치마크와 외부 데이터셋 실험에서 스칼라 드리프트를 완화하고 최고 성능을 달성했으며, 동영상 생성 강화학습에 신뢰할 수 있는 보상 신호를 제공합니다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗