AI 음성·영상 대화 학습 데이터 자동 생성 기술
Key Point
음성-영상 기반 AI 모델의 학습 데이터가 부족한 가운데, 합성 데이터로 모델을 학습하고 평가하는 새로운 방식이 실제 성능 개선으로 검증되었기 때문입니다.
핵심 요약
- 오디오와 영상을 직접 입력받아 텍스트로 답하는 '오므니비챗' 태스크를 정의하고, 별도 음성 인식이나 캡션 없이 사용자의 질문을 이해한다.
- 에이전트와 비디오 생성 기술을 활용해 합성된 대화 데이터를 만드는 '오므니비챗-스튜디오' 엔진을 개발했다.
- 합성 데이터로 오므니비챗 모델의 기본 대화 능력을 5개 카테고리로 평가하는 벤치마크를 구축했다.
- 강화학습 기반 보상 설계로 답변 정확성·효율성·스타일을 동시에 최적화하는 '오므니비챗-RL'을 제시했다.
- 합성 데이터로 학습한 Qwen3-Omni-Instruct는 벤치마크는 물론 실제 녹음 데이터에서도 성능 향상을 보였다.