Hugging Face 논문AI · 머신러닝

대화 상대 얼굴 반응 생성 AI, 음성 신호에 정확히 반응

원제 REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening

추천 17댓글 1Peizhen Li, Longbing Cao, Yang Zhang
Key Point

대화 상대의 자연스러운 표정 반응을 음성 신호에 정확히 동기화하는 기술이 구현되면서, 구체적인 모션 캡처 데이터와 실제 로봇 배포로 검증된 구체적 성과를 보여줍니다.

핵심 요약

  • 대화형 AI가 사람처럼 얼굴 표정과 몸짓으로 반응하는 것을 자동으로 생성하는 기술이 핵심 과제였다.
  • 스피커 음성에 정확히 맞춰 반응하되 기존 표정을 자연스럽게 유지하면서, 동시에 예측 불가능한 눈 깜빡임과 짧은 표정까지 캡처해야 한다는 두 가지 도전이 있다.
  • REALM이라는 프레임워크는 청자 모션 히스토리와 스피커 음성을 시간차를 중심으로 한 어텐션과 적응 게이팅으로 결합하는 Reactive Gated Speaker-Listener Fusion 모듈을 핵심으로 한다.
  • 거친 디코더가 기본 모션 궤도를 예측한 뒤, 표정 부분공간에서 음성 조건 확률적 잔차를 추가하면서 대체적 자세 파라미터는 유지한다.
  • ViCo와 L2L 데이터셋에서 기존 방식보다 다양한 모션 품질 지표에서 개선했고, 시간차 민감도·게이트 동작·눈 깜빡임 역학도 분석했다.
  • 생성된 행동을 Ameca 휴머노이드 로봇에 배포하고 사용자 지각 연구를 수행해 실제 구현 가능성을 입증했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗