Claude로 영상 편집, 코딩 에이전트 video-use 공개
Key Point
LLM의 토큰 효율성을 극적으로 높인 영상 처리 방식과, 프레임 단위 분석 대신 구조화된 텍스트 읽기로 영상 자동화의 스케일을 바꿀 수 있는 설계 원칙이 주목된다.
핵심 요약
- Claude Code를 활용해 폴더의 영상을 자동 편집하고 최종본을 받는 완전 오픈소스 도구를 공개했다.
- 음성 인식으로 필러 단어(umm, uh)와 긴 묵음을 제거하고, 자동 색보정과 30ms 오디오 페이드를 적용하며, 자막은 스타일을 커스텀할 수 있다.
- HyperFrames, Remotion, Manim, PIL을 통해 애니메이션 오버레이를 병렬로 생성할 수 있다.
- LLM이 영상 프레임을 직접 보지 않고 ElevenLabs Scribe로 단어 수준 타임스탬프가 있는 텍스트 트랜스크립트를 읽어 처리해, 30,000프레임×1,500토큰의 방식 대신 12KB 텍스트와 몇 개 PNG로 처리한다.
- 모든 편집 결정은 확인 후 실행되며, 렌더링 출력을 매 컷 경계에서 자동 검증해 시각적 점프와 오디오 팝을 사전에 감지한다.
- 프로젝트 상태가 project.md에 저장되어 다음 세션에서 이어서 편집할 수 있다.
저장소 보기 ↗github.com