합성 장면으로 시각 인식 키우는 멀티모달 AI 자체 학습법
원제 Where-OPD: Spatially Guided On-Policy Self-Distillation of MLLMs with Synthetic Scenes
추천 10댓글 1
Key Point
합성 데이터로 학습한 시각 AI가 실제 데이터에서도 3포인트 이상 성능 향상을 보이는 방식은 대규모 모델 개선의 비용 효율성을 높이려는 기업과 연구자들에게 실질적인 선택지가 된다.
핵심 요약
- 멀티모달 대형언어모델(MLLM)의 추론을 개선하기 위해 온-폴리시 자체 증류(on-policy self-distillation) 기법을 적용했다.
- 기존 방식은 이미지 일부를 자르거나 외부 교사 모델에 의존했지만, 이 연구는 공간 정보를 담은 텍스트 가이드를 통해 교사 모델에 특권 정보를 제공한다.
- 절차적으로 생성한 합성 장면에서 객체 정체성과 공간 좌표를 자동으로 얻을 수 있어, 인간 주석 없이 대규모 포스트 학습이 가능하다.
- 교사 모델은 공간 가이드를 이용해 여러 이미지 영역에서 관련 증거를 찾아 통합하고, 학생 모델은 질문과 이미지만으로 이 행동을 재현하는 법을 학습한다.
- 개수 세기, 문서 및 차트 이해 등 벤치마크에서 여러 모델의 성능이 일관되게 향상되었다.
- 합성 장면으로만 학습했음에도 실제 데이터로의 전이 효과가 나타나, CVBench, V*, ZoomBench, BLINK, HR-Bench, MME-RealWorld 등 현실 인식 벤치마크에서 평균 3.23포인트 개선되었다.
- 이는 공간 정보를 담은 특권 정보가 자체 증류를 통해 더 넓은 시각 인식 능력을 유도할 수 있으며, 학습에 쓰인 작업과 데이터 분포를 벗어나 합성에서 현실로의 전이가 가능함을 보여준다.