대화 상대 얼굴 반응 생성 AI, 음성 신호에 정확히 반응
원제 REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening
추천 17댓글 1
Key Point
대화 상대의 자연스러운 표정 반응을 음성 신호에 정확히 동기화하는 기술이 구현되면서, 구체적인 모션 캡처 데이터와 실제 로봇 배포로 검증된 구체적 성과를 보여줍니다.
핵심 요약
- 대화형 AI가 사람처럼 얼굴 표정과 몸짓으로 반응하는 것을 자동으로 생성하는 기술이 핵심 과제였다.
- 스피커 음성에 정확히 맞춰 반응하되 기존 표정을 자연스럽게 유지하면서, 동시에 예측 불가능한 눈 깜빡임과 짧은 표정까지 캡처해야 한다는 두 가지 도전이 있다.
- REALM이라는 프레임워크는 청자 모션 히스토리와 스피커 음성을 시간차를 중심으로 한 어텐션과 적응 게이팅으로 결합하는 Reactive Gated Speaker-Listener Fusion 모듈을 핵심으로 한다.
- 거친 디코더가 기본 모션 궤도를 예측한 뒤, 표정 부분공간에서 음성 조건 확률적 잔차를 추가하면서 대체적 자세 파라미터는 유지한다.
- ViCo와 L2L 데이터셋에서 기존 방식보다 다양한 모션 품질 지표에서 개선했고, 시간차 민감도·게이트 동작·눈 깜빡임 역학도 분석했다.
- 생성된 행동을 Ameca 휴머노이드 로봇에 배포하고 사용자 지각 연구를 수행해 실제 구현 가능성을 입증했다.