합성 장면으로 시각 인식 키우는 멀티모달 AI 자체 학습법
Key Point
합성 데이터로 학습한 시각 AI가 실제 데이터에서도 3포인트 이상 성능 향상을 보이는 방식은 대규모 모델 개선의 비용 효율성을 높이려는 기업과 연구자들에게 실질적인 선택지가 된다.
핵심 요약
- 멀티모달 대형언어모델(MLLM)의 추론을 개선하기 위해 온-폴리시 자체 증류(on-policy self-distillation) 기법을 적용했다.
- 기존 방식은 이미지 일부를 자르거나 외부 교사 모델에 의존했지만, 이 연구는 공간 정보를 담은 텍스트 가이드를 통해 교사 모델에 특권 정보를 제공한다.
- 절차적으로 생성한 합성 장면에서 객체 정체성과 공간 좌표를 자동으로 얻을 수 있어, 인간 주석 없이 대규모 포스트 학습이 가능하다.