쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 6일 (화)까지1768건
3건 · "오디오-비주얼"조건 지우기 ×
001▲ 12 · 댓글 1영상과 소리를 함께 생성하는 실시간 세계 모델 HelixWorld기존 세계 모델은 영상만 렌더링했지만, HelixWorld는 사용자 상호작용 하에서 카메라 관점의 영상과 공간 입체음향이 함께 진화하는 실시간 오디오-비주얼 세계 모델이다.AI · 머신러닝 · HelixWorld: A Real-time Interactive Audio-Visual World Model

Key Point기존의 침묵한 세계 모델에 처음으로 실시간 공간 음향을 추가하여, 메타버스·게임 엔진·3D 시뮬레이션에서 멀티센서 상호작용의 새로운 기준을 제시한다.
핵심 요약
- 기존 세계 모델은 영상만 렌더링했지만, HelixWorld는 사용자 상호작용 하에서 카메라 관점의 영상과 공간 입체음향이 함께 진화하는 실시간 오디오-비주얼 세계 모델이다.
- 진정한 입체 음향과 카메라 메트릭 포즈를 갖춘 고충실도 공간 오디오-비주얼 데이터셋을 구축하고, 6-DoF 카메라 궤적과 사용자 액션을 조건으로 하는 양방향 교사 모델을 사전학습했다.
- 저지연 인과적 상호작용을 위해 온라인 궤적 증류 손실을 통해 교사 모델을 소수 단계의 스트리밍 학생 모델로 증류하여, 단일 GPU에서 초당 24 프레임의 드리프트 없는 오디오-비주얼 롤아웃을 유지한다.
전체 요약 5문장 읽기 → 002▲ 14 · 댓글 2데이터 동영상을 자동으로 만드는 AI 도구 DataMagic데이터 동영상은 동적 차트, 음성 해설, 동기화된 애니메이션으로 데이터 인사이트를 전달하는 데이터 스토리텔링 형식이지만, 제작에는 데이터 분석·서사 설계·영상 편집 전문성이 필요했다.AI · 머신러닝 · DataMagic: Authoring Data Videos through Declarative Multi-Agent Orchestration

Key PointLLM만으로는 데이터 정확성과 서사 일관성을 동시에 보장하기 어려운 데이터 동영상 생성의 구조적 한계를 해결하는 실용적 접근법을 제시합니다.
핵심 요약
- 데이터 동영상은 동적 차트, 음성 해설, 동기화된 애니메이션으로 데이터 인사이트를 전달하는 데이터 스토리텔링 형식이지만, 제작에는 데이터 분석·서사 설계·영상 편집 전문성이 필요했다.
- 기존 시각화 도구는 서사와 애니메이션 기능이 부족하고, 저작 도구는 사전 준비된 차트에 의존하며, 픽셀 기반 모델은 데이터 정확성과 출처 추적을 보장하지 못한다.
- DataMagic은 원본 표 형식 데이터로부터 선언형 다중 에이전트 오케스트레이션을 통해 데이터 동영상을 자동 생성한다.
전체 요약 8문장 읽기 → 003▲ 15 · 댓글 3오디오와 비디오를 선택적으로 검색하는 추론 AIOmni-LLM을 기반으로 한 OmniSeek은 긴 오디오-비주얼 시퀀스를 통째로 처리하지 않고, 필요한 증거만 동적으로 선택해 검색하는 다중 턴 추론 에이전트이다.AI · 머신러닝 · OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

Key Point더 긴 멀티미디어 콘텐츠를 효율적으로 분석하고 필요한 부분만 집중하는 AI의 접근 방식이 어떻게 작동하는지 보여주기 때문이다.
핵심 요약
- Omni-LLM을 기반으로 한 OmniSeek은 긴 오디오-비주얼 시퀀스를 통째로 처리하지 않고, 필요한 증거만 동적으로 선택해 검색하는 다중 턴 추론 에이전트이다.
- 모델은 언제 보고 언제 들을지, 어느 시간 구간을 살펴볼지를 스스로 결정하며, 검색한 원본 오디오나 비주얼 세그먼트를 다시 컨텍스트에 추가해 다음 단계 추론을 지원한다.
- 이 능력을 학습시키기 위해 교차 모달리티 증거를 포함한 다중 홉 사고의 연쇄 궤적 17만 개(OmniTraj-170K)로 구성된 데이터셋을 합성했다.
전체 요약 5문장 읽기 →