meituan-longcat/LongCat-Video
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화
원제 meituan-longcat/LongCat-Video
스타 8,223당일 +120Python
Key Point
기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
- 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.
- 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다.
- 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다.
- 시간·공간축 기반 다단계 생성 전략과 블록 희소 어텐션으로 효율성을 높였다.
- 다중 보상 강화학습 기반 GRPO로 학습해 상용 모델 수준의 성능을 달성했다.
- 최신 버전인 1.5는 음성 입력 기반 캐릭터 애니메이션을 지원하고, Whisper 기반 입술 싱크 개선과 8단계 증류 기반 고속 추론을 제공한다.
저장소 보기 ↗github.com