쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1537건
3건 · "비디오 편집"조건 지우기 ×
001▲ 25 · 댓글 1MLLM의 추론력으로 영상 편집을 정밀하게 제어하는 ThinkV2V기존 영상 편집 방식은 MLLM을 의미 인코더로만 사용해 암묵적인 편집 지시를 제대로 처리하지 못했다.AI · 머신러닝 · ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
MLLM의 추론력으로 영상 편집을 정밀하게 제어하는 ThinkV2V

Key PointMLLM의 추론 능력을 활용해 기존에 처리하지 못하던 복잡한 영상 편집 지시를 정확히 따르는 방법을 제시하며, 더 작은 모델로 더 큰 기준선을 능가하는 결과를 보였다.
핵심 요약
- 기존 영상 편집 방식은 MLLM을 의미 인코더로만 사용해 암묵적인 편집 지시를 제대로 처리하지 못했다.
- ThinkV2V는 MLLM의 사고 과정을 명시적으로 활성화한 뒤 영상 생성을 진행하는 추론 기반 프레임워크를 제안한다.
- MLLM-to-DiT 아키텍처로 영상과 지시에 대한 사고를 정제된 신호로 변환해 편집을 제어한다.
전체 요약 6문장 읽기 → 002▲ 11 · 댓글 2영상 편집에 물리 엔진을 입혔다, VideoPhysEdit비디오 편집 기술이 그림자와 가림 현상 같은 시각적 효과는 잘 처리하지만, 물리 법칙에 따른 움직임 변화는 거의 다루지 않는다.AI · 머신러닝 · VideoPhysEdit: Physical Counterfactual Video Editing via Rigid-Body Physical Scene Reconstruction
영상 편집에 물리 엔진을 입혔다, VideoPhysEdit

Key Point비디오 편집에서 물리 시뮬레이션 기반 움직임 예측까지 다루는 새로운 접근으로, 현재 AI 영상 생성 기술의 큰 공백을 채운다.
핵심 요약
- 비디오 편집 기술이 그림자와 가림 현상 같은 시각적 효과는 잘 처리하지만, 물리 법칙에 따른 움직임 변화는 거의 다루지 않는다.
- 연구팀이 '물리적 반사실 비디오 편집(PCVE)' 문제를 정의했으니, 편집된 장면에서 물리 시뮬레이션으로 실제 움직임과 상호작용이 어떻게 변할지 예측하는 것이다.
- VideoPhysEdit은 학습 없이 동작하는 새로운 파이프라인으로, 정확한 물리 장면을 재구성해 현실의 움직임을 시뮬레이션에서 재현한 뒤, 편집을 중재(intervention)로 적용해 새로운 궤적을 생성한다.
전체 요약 6문장 읽기 → 003▲ 13 · 댓글 2사전학습 확산 모델로 스트리밍 비디오 실시간 편집SVEET은 사전학습된 양방향 비디오 확산 모델을 활용하면서 자회귀 방식으로 고품질 스트리밍 비디오 편집을 지원하는 프레임워크다.AI · 머신러닝 · Streaming Video Editing with Easy Adaptation
사전학습 확산 모델로 스트리밍 비디오 실시간 편집

Key Point비디오 편집의 실시간 스트리밍 처리가 GPU 한 개에서 15 FPS로 구현되면서 실제 응용 가능성이 높아졌으며, 사전학습 모델 활용으로 학습 비용을 줄인 점이 산업 적용의 진입장벽을 낮춘다.
핵심 요약
- SVEET은 사전학습된 양방향 비디오 확산 모델을 활용하면서 자회귀 방식으로 고품질 스트리밍 비디오 편집을 지원하는 프레임워크다.
- 기존 비디오-투-비디오 확산 방식을 재검토해 스트리밍 적응의 두 가지 핵심 원칙을 도출했다: 백본 특징 분리와 조건부 프레임 독립성.
- 보조 모델 브랜치가 시간 독립적 자기 주의로 소스 비디오를 인코딩하고, 중간 특징을 백본 블록에 주입해 스트리밍 호환 제어를 구현한다.
전체 요약 6문장 읽기 →