텍스트 손실 없이 멀티모달 임베딩 통합하는 경량 모델
원제 Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation
추천 15댓글 2
Key Point
기존 멀티모달 모델의 텍스트 성능 저하 문제를 해결하면서 매우 경량화한 기술로, 실제 프로덕션 배포에서 비용과 메모리 효율성이 크게 개선된다.
핵심 요약
- 기존 멀티모달 임베딩 모델은 텍스트, 음성, 오디오, 이미지, 비디오 등 새로운 모달리티를 추가할 때 텍스트 검색 성능이 저하되고, 수십억 개 파라미터가 필요했다.
- Omni-Embed-Mini는 0.9B 파라미터로 텍스트, 음성, 오디오, 이미지, 비디오, 문서를 단일 임베딩 공간에 매핑하면서 텍스트 파라미터는 고정해 손실을 방지한다.
- 핵심은 별도의 교사 모델 없이 각 미디어 샘플을 밀집 캐스케이딩 캡션과 쌍으로 만들고, 교사 신호는 고정된 백본의 캡션 임베딩을 그대로 사용한다는 것이다.
- 교사와 학생이 동일한 백본 가중치를 공유하므로 기하학적 구조가 동일하고, 경량 프로젝터와 모달리티 인코더의 단계적 LoRA 어댑터로 정렬한다.
- Matryoshka SigLIP 대조 손실과 온라인 하이브리드 하드 네거티브 마이너를 결합해 학습하며, 인코더 개선에 따라 네거티브 샘플이 강화된다.
- Omni-Embed-Mini-0.9B는 텍스트 가중치를 백본과 완전히 동일하게 유지해 MTEB-v2 BEIR-8에서 49.57 nDCG@10을 달성하면서 텍스트 검색 회귀가 불가능하다.
- 2.3B 변형 모델은 네이티브 비전-언어 백본을 사용하며 Gemini Embedding 2와 경쟁 가능한 수준이고 전체 모달리티 평균에서 앞선다.
- 모델, 코드, 데이터, 평가 도구는 공개되었고, 비교 대상 모든 오픈소스 멀티모달 임베더보다 2.7배에서 9.5배 작다.