쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 26일 (토)까지1064건
3건 · "텍스트-투-비디오"조건 지우기 ×
001▲ 18 · 댓글 0영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다.AI · 머신러닝 · WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE

Key Point텍스트-투-비디오 모델이 30초 길이의 영상까지 생성하면서 프롬프트 엔지니어링이 곧 영상 품질의 핵심이 되는데, WanPE는 일반인의 모호한 지문을 영화급 연출 지문으로 자동 변환해 현장에서 직접 활용 가능하다.
핵심 요약
- 텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다.
- 105만 개의 실제 영상으로 학습한 WanPE는 사용자의 텍스트 입력을 장면별 영화적 연출 계획(shot-level cinematic plan)으로 변환하며, 비디오 데이터에서 역구성(reverse construction)을 거쳐 프롬프트를 개선한다.
- 의미적 일관성을 유지하는 GRPO 강화학습(SC-GRPO)을 통해 여러 장면에 걸쳐 사용자의 의도가 왜곡되지 않도록 보장한다.
전체 요약 7문장 읽기 → 002▲ 25 · 댓글 2비디오 확산 모델이 물리법칙을 위반하는 이유텍스트-투-비디오 확산 모델이 우수한 화질에도 불구하고 현실 물리법칙을 위반하는 영상을 생성한다.AI · 머신러닝 · Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms
비디오 확산 모델이 물리법칙을 위반하는 이유

Key Point비디오 생성 AI의 핵심 약점인 물리법칙 위반을 어텐션 메커니즘 수준에서 진단하고, 모델 재설계 없이 적용 가능한 경량 해법을 제시한다.
핵심 요약
- 텍스트-투-비디오 확산 모델이 우수한 화질에도 불구하고 현실 물리법칙을 위반하는 영상을 생성한다.
- 연구팀이 모션 계획 과정을 분석해 초기 노이징 제거 단계에서 동작 궤적이 형성되는 방식을 규명했다.
- Rotary Position Embedding(RoPE)이 과도한 공간 주의 감소를 야기해 초기 후보 영역이 물리적으로 불가능한 위치에 조기 고정되는 것을 발견했다.
전체 요약 5문장 읽기 → 003당일 +120중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.AI · 머신러닝 · meituan-longcat/LongCat-Video · Python
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화

Key Point기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
- 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.
- 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다.
- 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다.
전체 요약 6문장 읽기 →