Hacker News인프라 · 데브옵스

벡터 인덱스 중심에서 벗어난다, 터보퍼 v3

원제 RIP, vector database

115 포인트댓글 27
Key Point

벡터 데이터베이스 설계의 근본적 전환으로, 다중 쿼리 패턴 지원 시 구조적 한계를 어떻게 극복하는지 보여주는 사례입니다.

핵심 요약

  • 터보퍼가 저장소 아키텍처를 재설계하면서 벡터 검색뿐 아니라 SQL 쿼리까지 빠르게 처리하려고 한다.
  • v1은 서버리스 벡터 데이터베이스로 출발했고, v2에서 텍스트·정규식 검색을 추가했으며, 현재 Linear의 동기화 엔진 같은 비검색 용도로도 사용 중이다.
  • 기존 아키텍처는 ANN(근사 최근접) 벡터 인덱스를 주요 인덱스로 삼아 모든 데이터를 벡터의 클러스터 ID와 로컬 ID로 키잉했다.
  • 이 설계는 세 가지 문제를 야기한다: 다중 벡터 표현 시 문서 내용을 복제해야 하는 저장 증폭, 벡터 재균형 시 전체 문서를 옮겨야 하는 쓰기 증폭, 쿼리 엔진 최적화를 제약하는 블록 크기 한계이다.
  • 예를 들어 v1 전문검색은 ANN 클러스터 경계에 따라 1.5개 문서만 처리했지만, v2에서 고정 블록 256개로 재설계하자 인덱스 크기는 10분의 1로 줄고 쿼리 속도는 최대 20배 빨라졌다.
  • v3는 ANN 주소를 주 키에서 제거하고 'ANN을 또 다른 보조 인덱스로 만든다'는 간단한 원칙으로 모든 문제를 풀려고 한다.
  • 이달 초 CI 테스트 100% 통과 마일스톤을 달성했으며, 지금부터 성능 최적화에 집중한다.
  • 향후 몇 주 동안 벤치마크를 공개하면서 본격 배포 전에 성능 동등성을 달성할 계획이다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗