텍스트·이미지·영상·음성을 하나로 이해하는 멀티모달 임베딩 모델 공개
Key Point
단일 모달리티 검색의 한계를 극복하고 텍스트-영상, 음성-텍스트 등 크로스 모달 검색이 필요한 개발자와 연구자에게 새로운 기술 선택지를 제공한다.
핵심 요약
- Hugging Face 연구팀이 텍스트, 이미지, 영상, 음성을 통합으로 처리하는 Ovis-Embedding을 발표했다.
- 기존의 분리된 모달리티 타워 대신 공유 멀티모달 백본을 사용해 모든 데이터를 공통 표현 공간으로 인코딩한다.
- Qwen-omni 사전학습 모델을 기반으로 대조 학습과 저랭크 초기화를 통해 학습했다.
- 다양한 멀티모달 데이터 코퍼스와 균질 소스 샘플링으로 학습 효율을 높였으며, 포컬 손실과 임베딩 증류를 적용했다.
- MMEB-v3, MVEB, MAEB 등 주요 벤치마크에서 최고 성능을 달성했으며, 추론 시 저랭크 특성 분해로 임베딩 크기를 유연하게 조절할 수 있다.