통합 모델이 자기 생성물을 스스로 고치는 방법 찾았다
원제 Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
추천 35댓글 2
Key Point
생성형 AI 모델이 자신의 오류를 인식하고 반복적으로 수정하는 능력을 학습하는 방식이 바뀌고 있으며, 이는 이미지 생성의 품질 향상과 모델 구조의 단순화를 동시에 이룬다.
핵심 요약
- 이미지를 보고 만들 수 있는 통합 멀티모달 모델에서, 생성된 이미지의 문제를 진단하고 수정하는 과정을 자동으로 학습하는 방법을 제시했다.
- 기존 지도 학습(SFT)은 시작은 빠르지만 효과적인 수정 경로를 찾지 못했고, 렌더러나 한 부분만 최적화하는 단순한 강화학습(RL)은 잠재력을 충분히 활용하지 못했다.
- UMM-Reflection은 강화학습을 반사 궤적 전체에 적용하되, 같은 초기 이미지를 공유하는 자매 궤적들의 상대적 이점으로 반사 전략을 비교하고, 한 번의 궤적 단위 이점으로 반사 텍스트와 흐름 기반 수정을 함께 업데이트한다.
- 이 방식은 각 라운드별 신용 할당의 조합 폭발을 피하고, 단일 라운드 편집이나 외부 평가자를 사용하는 파이프라인과 달리 여러 라운드를 거쳐 신용이 흐르며 같은 모델의 두 역할 모두에 업데이트된다.
- BAGEL 데이터셋에서 SFT 대비 GenEval이 12.05점 향상되었고, WISE(+10.97점), OneIG-Bench(+3.48점), T2I-CompBench++(+4.63점)에도 전이 학습이 이루어졌으며 이 벤치마크들은 학습에 사용되지 않았다.
- 추론 시점에 별도의 검증기가 필요 없다.