임베딩 벡터를 쌍 데이터 없이 변환하는 방법 개발

Key Point
서로 다른 AI 모델의 임베딩을 통역할 수 있다는 것은 모델 간 상호운용성을 높이지만, 동시에 벡터 데이터베이스의 민감 정보 노출 위험을 직시하게 한다.
핵심 요약
- 텍스트 임베딩을 한 벡터 공간에서 다른 공간으로 옮기는 비지도 학습 방법을 제시했다.
- 쌍 데이터, 인코더, 미리 정의된 매치 없이 범용 잠재 표현(Platonic Representation Hypothesis)으로 변환한다.
- 서로 다른 아키텍처·파라미터 크기·학습 데이터를 가진 모델 간에도 높은 코사인 유사도를 달성한다.
- 임베딩 벡터만으로도 원본 문서 정보를 추출해 분류나 속성 추론에 이용할 수 있어 벡터 데이터베이스의 보안 문제를 드러낸다.