GitHub TrendingAI · 머신러닝

meituan-longcat/LongCat-Video

중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화

원제 meituan-longcat/LongCat-Video

스타 8,223당일 +120Python
Key Point

기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.

핵심 요약

  • 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다.
  • 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다.
  • 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다.
  • 시간·공간축 기반 다단계 생성 전략과 블록 희소 어텐션으로 효율성을 높였다.
  • 다중 보상 강화학습 기반 GRPO로 학습해 상용 모델 수준의 성능을 달성했다.
  • 최신 버전인 1.5는 음성 입력 기반 캐릭터 애니메이션을 지원하고, Whisper 기반 입술 싱크 개선과 8단계 증류 기반 고속 추론을 제공한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗