Hugging Face 논문AI · 머신러닝

영상과 소리를 함께 생성하는 실시간 세계 모델 HelixWorld

원제 HelixWorld: A Real-time Interactive Audio-Visual World Model

추천 12댓글 1Lei Ke, Jiahao Pan, Zeyue Tian 외
Key Point

기존의 침묵한 세계 모델에 처음으로 실시간 공간 음향을 추가하여, 메타버스·게임 엔진·3D 시뮬레이션에서 멀티센서 상호작용의 새로운 기준을 제시한다.

핵심 요약

  • 기존 세계 모델은 영상만 렌더링했지만, HelixWorld는 사용자 상호작용 하에서 카메라 관점의 영상과 공간 입체음향이 함께 진화하는 실시간 오디오-비주얼 세계 모델이다.
  • 진정한 입체 음향과 카메라 메트릭 포즈를 갖춘 고충실도 공간 오디오-비주얼 데이터셋을 구축하고, 6-DoF 카메라 궤적과 사용자 액션을 조건으로 하는 양방향 교사 모델을 사전학습했다.
  • 저지연 인과적 상호작용을 위해 온라인 궤적 증류 손실을 통해 교사 모델을 소수 단계의 스트리밍 학생 모델로 증류하여, 단일 GPU에서 초당 24 프레임의 드리프트 없는 오디오-비주얼 롤아웃을 유지한다.
  • 공간-음향 일관성을 형식화하고 HelixBench 벤치마크를 도입해 합성 음장이 동적 시점 변화를 충실하게 추적하는지 평가한다.
  • 광범위한 실험 결과 HelixWorld는 기존 무음 세계 모델과 영상 충실도 및 응답성에서 동등하면서도, 카메라 정렬 공간-음향 몰입감에서 기존 기준 모델들을 크게 능가한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗