영상 생성 AI의 보상 신호 불안정성, 기준 기반 평가로 해결
Key Point
영상 생성 AI를 강화학습으로 최적화할 때 보상 신호의 불안정성은 학습 효율을 크게 떨어뜨리는데, 명시적 평가 기준을 도입하는 이 접근법이 문제 해결에 새로운 방향을 제시한다.
핵심 요약
- 영상 생성 모델 강화학습에서 핵심인 보상 모델이 복잡한 영상 품질을 단일 점수로 직접 변환하면서 점수 기준이 프롬프트마다 붕괴되거나 이동하는 '스칼라 드리프트' 문제가 발생한다.
- RewardVerse는 평가 기준을 동적으로 생성한 후 그에 맞춰 점수를 매기는 방식으로, 명시적 평가 기준을 중간 표현으로 삽입해 점수의 안정성을 높인다.
- 이를 효율적으로 최적화하기 위해 제안된 Rubric-Guided Policy Optimization(RGPO)는 자기진화 초기 기준으로 평가 모델을 먼저 준비한 후, 기준 생성기와 평가기를 함께 최적화하면서 인간 평가와 정렬하는 2단계 학습 알고리즘이다.