대화 상대 얼굴 반응 생성 AI, 음성 신호에 정확히 반응
Key Point
대화 상대의 자연스러운 표정 반응을 음성 신호에 정확히 동기화하는 기술이 구현되면서, 구체적인 모션 캡처 데이터와 실제 로봇 배포로 검증된 구체적 성과를 보여줍니다.
핵심 요약
- 대화형 AI가 사람처럼 얼굴 표정과 몸짓으로 반응하는 것을 자동으로 생성하는 기술이 핵심 과제였다.
- 스피커 음성에 정확히 맞춰 반응하되 기존 표정을 자연스럽게 유지하면서, 동시에 예측 불가능한 눈 깜빡임과 짧은 표정까지 캡처해야 한다는 두 가지 도전이 있다.
- REALM이라는 프레임워크는 청자 모션 히스토리와 스피커 음성을 시간차를 중심으로 한 어텐션과 적응 게이팅으로 결합하는 Reactive Gated Speaker-Listener Fusion 모듈을 핵심으로 한다.