이미지 생성 AI를 판단하는 새로운 기준, 생각하는 리워드 모델
원제 Think Before You Score: Thinking Reward Model for Visual Generation
추천 44댓글 1
Key Point
이미지 생성 AI의 자동 평가 방식을 근본적으로 바꾸고, 이를 통해 생성 모델 최적화를 더 효과적으로 할 수 있다는 점이 중요합니다.
핵심 요약
- 이미지 생성 AI의 성능을 평가하는 리워드 모델 개선 연구로, 기존 방식이 평가 기준을 암묵적으로만 적용하는 문제를 해결합니다.
- 제안하는 TRM(Thinking Reward Model)은 각 상황에 맞춘 평가 기준을 먼저 명시적으로 결정한 후 생성 결과를 판단하는 방식으로 작동합니다.
- 경우별로 적응형 평가 기준을 만들고, 기준에 맞춰 세부 평가를 수행한 뒤 미세한 정도의 점수를 산출합니다.
- 기존의 쌍비교 선호도 최적화가 점수 양극화를 유발한다는 문제를 발견하고, 이를 개선한 PD-GRPO 기법을 제시합니다.
- 이미지 생성·편집 평가 벤치마크에서 오픈소스 모델 중 최고 성능을 달성했으며, 상용 모델과도 경쟁력 있는 수준입니다.
- TRM을 강화학습의 리워드로 사용하면 다양한 생성 AI 모델의 성능을 일관되게 향상시키며, 세밀한 평가 신호가 실제 개선으로 이어짐을 보였습니다.