Hugging Face 논문AI · 머신러닝

AI 음성·영상 대화 학습 데이터 자동 생성 기술

원제 OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

추천 47댓글 4Haolin He, Yunfei Chu, Qi Chen 외
Key Point

음성-영상 기반 AI 모델의 학습 데이터가 부족한 가운데, 합성 데이터로 모델을 학습하고 평가하는 새로운 방식이 실제 성능 개선으로 검증되었기 때문입니다.

핵심 요약

  • 오디오와 영상을 직접 입력받아 텍스트로 답하는 '오므니비챗' 태스크를 정의하고, 별도 음성 인식이나 캡션 없이 사용자의 질문을 이해한다.
  • 에이전트와 비디오 생성 기술을 활용해 합성된 대화 데이터를 만드는 '오므니비챗-스튜디오' 엔진을 개발했다.
  • 합성 데이터로 오므니비챗 모델의 기본 대화 능력을 5개 카테고리로 평가하는 벤치마크를 구축했다.
  • 강화학습 기반 보상 설계로 답변 정확성·효율성·스타일을 동시에 최적화하는 '오므니비챗-RL'을 제시했다.
  • 합성 데이터로 학습한 Qwen3-Omni-Instruct는 벤치마크는 물론 실제 녹음 데이터에서도 성능 향상을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗