멀티모달 AI가 자기 피드백으로 스스로 성장하는 방법
원제 UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement
추천 196댓글 2
Key Point
외부 감독 없이 AI 모델이 자신의 비판적 피드백으로 스스로 개선되는 메커니즘을 제시해, 모델 성능 향상의 새로운 가능성을 보여준다.
핵심 요약
- 현대 멀티모달 모델은 생성과 이해를 하나의 시스템에 통합해 자신의 피드백으로부터 학습할 수 있는 잠재력을 가지고 있다.
- UniEvo-VL은 이러한 능력을 활용해 모델이 테스트 타임에 자기수정 피드백으로부터 배우도록 하는 자기진화 프레임워크다.
- 별도의 큰 교사 모델에 의존하는 대신, 단일 멀티모달 모델이 서로 다른 맥락에서 교사와 학생 역할을 동시에 수행한다.
- 학생은 원본 질문만 받고, 교사는 특권 정보인 자기비평 정보를 추가로 받아 조건화된다.
- 학습은 모델이 자신의 샘플링 궤적 위에서 생성하는 디노이징 확산 분포 간 상태별 발산을 최소화한다.
- Qwen-image-2512를 기반으로 한 실험에서 GenEval 점수는 0.747에서 0.808로, GenEval2 Soft-TIFA는 32.97에서 35.53으로 향상되었다.
- 더 강력한 외부 비평가(예: GPT5.6-Luna)를 사용한 실험에서 우수한 판단 능력을 가진 멀티모달 모델이 더 높은 자기진화 한계를 기대할 수 있음을 보여준다.
- 텍스트 렌더링 결과는 자기진화 성능이 작업별로 균일하지 않을 수 있음을 시사한다.