Hugging Face 논문AI · 머신러닝

음성·영상 AI의 할루시네이션 문제, 질문 재라우팅으로 해결

원제 Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models

추천 10댓글 2Yu Zhang, Pingrui Zhang, Xuefeng Bai 외
Key Point

음성·영상을 함께 처리하는 AI 시스템에서 불필요한 정보로 인한 오답 문제를 진단하고 해결하는 구체적 방법이 제시되어, 멀티모달 모델의 신뢰성을 높이는 데 직접 적용 가능하다.

핵심 요약

  • 음성·영상 정보를 함께 다루는 대형언어모델(AVLLM)이 사용하지 않아야 할 모달리티의 신호까지 반영해 잘못된 답변을 생성하는 '소스-혼동 할루시네이션' 문제가 발생한다.
  • 연구팀이 경로 개입과 표현 분석을 통해 이 문제의 내부 메커니즘을 규명했다: 질문 상태가 필요한 모달리티의 증거뿐 아니라 간섭 신호도 함께 전달하며, 생성 단계보다는 질문 단계에서 간섭을 차단할 때 더 효과적이다.
  • 이를 바탕으로 SECRET(SourcE-Conditioned RElay sTeering)이라는 훈련 불필요 방식을 제안했다: 서로 다른 모달리티 경로로 추출한 대조적 질문 표현을 이용해 원래 질문을 필요한 소스의 증거로 유도한다.
  • CMM, AVHBench 벤치마크와 3개 AVLLM에서 테스트한 결과 SECRET은 기존 훈련 불필요 방식을 능가했고, 기본 모델 대비 최대 18.0%, 7.1% 포인트 향상시켰다.
  • 개방형 생성(음성·영상 캡셔닝)에서도 효과가 일관되게 나타나 방법의 범용성이 입증되었다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗