쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 30일 (수)까지 1383건
22건 · "생성 모델"조건 지우기 ×
001 18:11 ▲ 10 · 댓글 1 계층적 표현 학습으로 이미지 재구성 품질 향상 사전학습된 시각 표현은 이미지 생성에는 유용하지만 충실한 복원에 필요한 세부 사항을 완전히 보존하지 못한다. AI · 머신러닝 · HiRAE: Hierarchical Representation Autoencoding with Residual Budgets
계층적 표현 학습으로 이미지 재구성 품질 향상 Key Point 인코더 계층의 다중 정보를 효율적으로 활용해 이미지 복원 품질을 크게 높인 방법론으로, 복잡한 튜닝 없이 생성 모델과의 호환성을 유지하는 점이 실무적 가치가 있다.
핵심 요약
사전학습된 시각 표현은 이미지 생성에는 유용하지만 충실한 복원에 필요한 세부 사항을 완전히 보존하지 못한다. 인코더의 중간 계층들은 보완적인 시각 정보를 가지고 있으나 이들을 효과적으로 융합하면 모델링이 어려운 잠재 분포가 생성된다. 기존 융합 방식은 계층 선택의 경험적 튜닝이나 단계별 최적화가 필요해 설정 비용과 학습 복잡도가 높다. 전체 요약 8문장 읽기 → 002 18:11 ▲ 12 · 댓글 1 비디오 생성 모델로 로봇 팔 스스로 학습하게 하다 로봇이 새로운 작업을 배울 때 전문가 시연 데이터 없이 학습하는 문제를 다룬다. AI · 머신러닝 · EVO-WAM: Evolving World Action Models through Video-Action Verification
비디오 생성 모델로 로봇 팔 스스로 학습하게 하다 Key Point 시뮬레이션과 실제 환경 모두에서 로봇 정책 적응 성공률을 2.5배 이상 높이는 새로운 방식이 필요한 상황에서, 외부 데이터 수집 없이 모델 자체의 피드백 루프로 학습하는 접근법을 제시한다.
핵심 요약
로봇이 새로운 작업을 배울 때 전문가 시연 데이터 없이 학습하는 문제를 다룬다. 월드 액션 모델(WAM)은 비디오와 행동을 함께 예측해 작업 적응의 감독 신호로 쓰이지만, 생성된 영상이 작업 완료를 보여주지 못하거나 영상-행동 불일치로 실행 실패가 발생한다. EVO-WAM은 외부 환경 실행 없이 자체 생성 비디오-행동 궤적으로부터 학습해 WAM을 적응시킨다. 전체 요약 8문장 읽기 → 003 18:11 ▲ 12 · 댓글 2 한 번의 단계로 4K 영상 생성하는 비디오 정제 기법 발표 저해상도 비디오를 고해상도로 변환하는 과정에서 기존 다단계 정제는 계산 병목이 되는 문제를 해결하기 위해 한 번의 디노이징 단계로 4K 영상을 생성하는 SoL-Refiner를 제시했다. AI · 머신러닝 · SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video
한 번의 단계로 4K 영상 생성하는 비디오 정제 기법 발표 Key Point 고해상도 비디오 생성의 계산 비용을 획기적으로 줄이면서도 품질을 유지하는 방법론으로, 실시간 영상 생성 애플리케이션의 실용화에 직접 영향을 준다.
핵심 요약
저해상도 비디오를 고해상도로 변환하는 과정에서 기존 다단계 정제는 계산 병목이 되는 문제를 해결하기 위해 한 번의 디노이징 단계로 4K 영상을 생성하는 SoL-Refiner를 제시했다. 고해상도 지속 학습, 강화학습(RL) 후학습, 한 단계 증류의 세 단계 학습 레시피를 적용했다. 논문은 다양한 비디오 생성 모델의 출력을 바탕으로 한 Refiner-Bench 벤치마크를 구축하고, 약 2K 해상도에서 다양한 정제 모델을 비교하는 공통 입력 프로토콜을 도입했다. 전체 요약 5문장 읽기 → 004 18:11 ▲ 11 · 댓글 1 로봇 매니퓨레이션을 위한 영상 시뮬레이터 WorldLine 공개 로봇 학습의 물리적 실행 비용을 줄이기 위해 영상 생성 모델 기반 시각 시뮬레이터가 필요한데, 기존 모델은 행동 추종 정확도와 로봇-객체 동역학 일관성이 부족하고 구체적 제어 데이터에 의존한다. AI · 머신러닝 · WorldLine: Action-Driven Visual Simulation for Robotic Manipulation
로봇 매니퓨레이션을 위한 영상 시뮬레이터 WorldLine 공개 Key Point 로봇 매니퓰레이션 학습에서 물리적 실행 없이 행동 결과를 예측할 수 있는 범용 시뮬레이터는 개발 비용과 안전 위험을 크게 줄일 수 있기 때문입니다.
핵심 요약
로봇 학습의 물리적 실행 비용을 줄이기 위해 영상 생성 모델 기반 시각 시뮬레이터가 필요한데, 기존 모델은 행동 추종 정확도와 로봇-객체 동역학 일관성이 부족하고 구체적 제어 데이터에 의존한다. WorldLine은 행동 기반 시각 시뮬레이터로, 전이 가능한 동역학 학습을 이질적인 행동 그라운딩으로부터 분리한다. 10,000시간 이상의 행동 없는 로봇 영상과 10개 이상 로봇 체형에서 2,000시간 이상의 행동 궤적으로 학습한다. 전체 요약 8문장 읽기 → 005 15:11 ▲ 13 · 댓글 1 동영상 생성 모델의 '일괄 증류' 기술 공개 동영상 확산 모델이 다양한 작업에 특화되면서 각각 증류 단계를 반복하는 비효율이 발생하고 있다. AI · 머신러닝 · LongLive-Plug: Once-for-All Distillation for Video Generation
동영상 생성 모델의 '일괄 증류' 기술 공개 Key Point 동영상 생성 모델 특화로 인한 반복 학습 비용을 획기적으로 줄이는 기술로, 실제 배포된 54개 모델에서 검증되었기 때문에 현실성 있는 효율화 방안을 제시한다.
핵심 요약
동영상 확산 모델이 다양한 작업에 특화되면서 각각 증류 단계를 반복하는 비효율이 발생하고 있다. LongLive-Plug는 한 번의 학습으로 여러 모델에 재사용 가능한 기능을 LoRA로 학습하는 일괄 증류 프레임워크다. 단일 패스 분류기 없는 가이던스, 소수 단계 샘플링, 자동회귀 생성의 장기 맥락 오류 보정 기능을 제공한다. 전체 요약 8문장 읽기 → 006 15:11 ▲ 44 · 댓글 1 이미지 생성 AI를 판단하는 새로운 기준, 생각하는 리워드 모델 이미지 생성 AI의 성능을 평가하는 리워드 모델 개선 연구로, 기존 방식이 평가 기준을 암묵적으로만 적용하는 문제를 해결합니다. AI · 머신러닝 · Think Before You Score: Thinking Reward Model for Visual Generation
이미지 생성 AI를 판단하는 새로운 기준, 생각하는 리워드 모델 Key Point 이미지 생성 AI의 자동 평가 방식을 근본적으로 바꾸고, 이를 통해 생성 모델 최적화를 더 효과적으로 할 수 있다는 점이 중요합니다.
핵심 요약
이미지 생성 AI의 성능을 평가하는 리워드 모델 개선 연구로, 기존 방식이 평가 기준을 암묵적으로만 적용하는 문제를 해결합니다. 제안하는 TRM(Thinking Reward Model)은 각 상황에 맞춘 평가 기준을 먼저 명시적으로 결정한 후 생성 결과를 판단하는 방식으로 작동합니다. 경우별로 적응형 평가 기준을 만들고, 기준에 맞춰 세부 평가를 수행한 뒤 미세한 정도의 점수를 산출합니다. 전체 요약 6문장 읽기 → 007 21:11 ▲ 112 · 댓글 2 코드 에이전트 강화학습에서 품질 기반 보상 재분배하는 GAGAR 제안 기존 코드 에이전트 강화학습은 실행 가능한 테스트로 이진 보상을 제공하는데, Group Relative Policy Optimization(GRPO)은 테스트를 통과한 모든 궤적에 동일한 이득을 할당하여 구현 품질의 차이를 무시하는 문제가 있다. AI · 머신러닝 · Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
코드 에이전트 강화학습에서 품질 기반 보상 재분배하는 GAGAR 제안 Key Point 테스트 통과 여부만 판단하던 기존 강화학습에서 구현 품질 차이를 감지하는 에이전트를 추가하면 코드 생성 모델의 학습 신호가 더 정교해진다.
핵심 요약
기존 코드 에이전트 강화학습은 실행 가능한 테스트로 이진 보상을 제공하는데, Group Relative Policy Optimization(GRPO)은 테스트를 통과한 모든 궤적에 동일한 이득을 할당하여 구현 품질의 차이를 무시하는 문제가 있다. 이를 보완하기 위해 GAGAR 프레임워크를 제안하는데, 통과 및 실패 궤적을 모두 포함하는 그룹만 선별하여 동적 샘플링한다. 각 그룹의 모든 궤적을 공유 작업공간에 놓고, SFT 학습된 에이전트 평가자가 이들을 함께 검사하여 테스트 통과 후보들을 순위 매긴다. 전체 요약 7문장 읽기 → 008 18:11 ▲ 11 · 댓글 1 생성 AI의 시각적 문제해결 능력 평가하는 벤치마크 기존 벤치마크는 지각, 생성, 명시적 변환만 평가하며 목표 기반의 시각적 문제해결은 평가하지 못했다. AI · 머신러닝 · SolveEdit: Benchmarking Visual Problem Solving in Generative Models
생성 AI의 시각적 문제해결 능력 평가하는 벤치마크 Key Point 생성 AI가 물체 배치, 레이아웃 수정 같은 시각적 목표 달성 문제를 얼마나 잘 풀 수 있는지 체계적으로 평가할 수 있게 되었다.
핵심 요약
기존 벤치마크는 지각, 생성, 명시적 변환만 평가하며 목표 기반의 시각적 문제해결은 평가하지 못했다. SolveEdit은 이미지와 목표가 주어졌을 때 장면을 변환하는 생성 모델의 능력을 평가하는 벤치마크다. 모델은 요청·장면·시각적 규칙에서 유효한 변환을 추론한 뒤 무관한 내용은 보존하면서 실행해야 한다. 전체 요약 6문장 읽기 → 009 18:11 ▲ 15 · 댓글 2 DiT의 잔차 연결을 재설계해 이미지 생성 성능 향상 Diffusion Transformers(DiT)는 이미지 합성의 확장 가능한 기반 모델이지만, 기존 U-Net 모델의 수작업 스킵 연결과 달리 모든 층의 출력을 단순히 누적하는 단일 잔차 흐름을 사용한다. AI · 머신러닝 · Structured Residual Connectivity Matters for Diffusion Transformers
DiT의 잔차 연결을 재설계해 이미지 생성 성능 향상 Key Point Diffusion Transformer의 성능을 좌우하는 잔차 연결 구조를 근본적으로 개선하는 방법론이 제시되어, 향후 이미지 생성 모델 설계의 새로운 기준이 될 가능성이 있다.
핵심 요약
Diffusion Transformers(DiT)는 이미지 합성의 확장 가능한 기반 모델이지만, 기존 U-Net 모델의 수작업 스킵 연결과 달리 모든 층의 출력을 단순히 누적하는 단일 잔차 흐름을 사용한다. 연구팀은 DiT의 내부 표현을 체계적으로 분석해 초기 층의 특성 재사용과 대칭적 층 가이던스를 중시하는 경향을 발견했다. 이를 바탕으로 각 트랜스포머 블록이 이전 층의 중요한 표현을 선택적으로 '주목'하고, 직접적이고 미분 가능한 크로스-뎁스 경로를 통해 공간적·의미적 정보를 동적으로 검색하는 적응형 연결 메커니즘을 제안했다. 전체 요약 7문장 읽기 → 010 00:11 ▲ 36 · 댓글 1 영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE 텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다. AI · 머신러닝 · WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE Key Point 텍스트-투-비디오 모델이 30초 길이의 영상까지 생성하면서 프롬프트 엔지니어링이 곧 영상 품질의 핵심이 되는데, WanPE는 일반인의 모호한 지문을 영화급 연출 지문으로 자동 변환해 현장에서 직접 활용 가능하다.
핵심 요약
텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다. 105만 개의 실제 영상으로 학습한 WanPE는 사용자의 텍스트 입력을 장면별 영화적 연출 계획(shot-level cinematic plan)으로 변환하며, 비디오 데이터에서 역구성(reverse construction)을 거쳐 프롬프트를 개선한다. 의미적 일관성을 유지하는 GRPO 강화학습(SC-GRPO)을 통해 여러 장면에 걸쳐 사용자의 의도가 왜곡되지 않도록 보장한다. 전체 요약 7문장 읽기 → 011 22:45 당일 +166 C++로 만든 이미지 생성 엔진, Flux·Qwen 등 최신 모델까지 지원 stable-diffusion.cpp는 GGML 기반의 순수 C/C++ 구현으로 Stable Diffusion, Flux, Wan, Qwen Image 등 다양한 이미지·영상 생성 모델을 추론할 수 있는 경량 프레임워크다. AI · 머신러닝 · leejet/stable-diffusion.cpp · C++
C++로 만든 이미지 생성 엔진, Flux·Qwen 등 최신 모델까지 지원 Key Point 로컬 머신에서 최신 이미지·영상 생성 모델을 실행할 수 있는 경량 C++ 구현이 빠르게 성장하고 있으며, 모델 추가 속도가 빠르므로 개인 또는 온프레미스 AI 구축을 고려하는 개발자에게 선택지가 되고 있다.
핵심 요약
stable-diffusion.cpp는 GGML 기반의 순수 C/C++ 구현으로 Stable Diffusion, Flux, Wan, Qwen Image 등 다양한 이미지·영상 생성 모델을 추론할 수 있는 경량 프레임워크다. 외부 의존성이 없으며, 모델 무게 형식으로 PyTorch 체크포인트(.ckpt, .pth, .pt), Safetensors, GGUF를 지원하고 가중치를 .gguf나 .safetensors로 변환할 수 있다. CPU(AVX, AVX2, AVX512), CUDA, Vulkan, Metal, OpenCL, SYCL 백엔드를 지원하며 Linux, macOS, Windows, Android(Termux)에서 실행된다. 전체 요약 7문장 읽기 → 012 22:26 ▲ 203 · 댓글 2 물체 지속성 학습으로 세계 모델 강화하기 비디오 생성 모델이 인간처럼 물체가 사라져도 존재한다는 사실(물체 지속성)을 이해하는지 검증하는 논문이다. AI · 머신러닝 · Training Object Permanence in World Models
물체 지속성 학습으로 세계 모델 강화하기 Key Point 최신 비디오 모델들이 물리적 추론 능력을 갖추고 있는지 체계적으로 검증하는 첫 대규모 인지과학 기반 벤치마크로, 이후 세계 모델 개발의 방향을 제시한다.
핵심 요약
비디오 생성 모델이 인간처럼 물체가 사라져도 존재한다는 사실(물체 지속성)을 이해하는지 검증하는 논문이다. 연구진은 인지과학 원리에서 영감을 받아 6개 범주의 150가지 인지 과제로 구성된 WROP 데이터셋을 제시했다. Blender를 이용해 속도, 조명, 카메라 각도 등을 무작위로 변화시키면서 각 과제의 인지 구조를 유지하여 작업당 10,000개 이상의 샘플을 생성했다. 전체 요약 6문장 읽기 → 013 22:29 당일 +209 ComfyUI, 노드 기반 멀티모달 AI 생성 엔진으로 거듭나다 ComfyUI는 그래프/노드 인터페이스 기반의 강력한 AI 생성 엔진으로, 이미지·비디오·3D·오디오·텍스트 생성을 한 플랫폼에서 지원한다. AI · 머신러닝 · Comfy-Org/ComfyUI · Python
ComfyUI, 노드 기반 멀티모달 AI 생성 엔진으로 거듭나다 Key Point 노드 기반 워크플로우로 최신 오픈소스 생성 모델들을 자유롭게 조합하되, 로컬 실행·API 통합·클라우드 지원을 한 도구에서 선택할 수 있어 전문가부터 초심자까지 콘텐츠 제작 자동화의 진입장벽을 낮춘다.
핵심 요약
ComfyUI는 그래프/노드 인터페이스 기반의 강력한 AI 생성 엔진으로, 이미지·비디오·3D·오디오·텍스트 생성을 한 플랫폼에서 지원한다. Stable Diffusion, SDXL, Flux.1/2, Qwen Image, Hunyuan Image, Ideogram 등 주요 이미지 모델과 LTX-Video, HunyuanVideo 같은 영상 생성, ACE-Step, Stable Audio 등 오디오 생성 모델을 기본 지원한다. Partner nodes를 통해 폐쇄형 모델(Nano Banana, Seedance, Hunyuan3D 등)에도 접근할 수 있으며, API 엔드포인트로 프로덕션 파이프라인에 통합 가능하다. 전체 요약 9문장 읽기 → 014 22:29 ▲ 24 · 댓글 2 영상 생성 AI의 보상 신호 불안정성, 기준 기반 평가로 해결 영상 생성 모델 강화학습에서 핵심인 보상 모델이 복잡한 영상 품질을 단일 점수로 직접 변환하면서 점수 기준이 프롬프트마다 붕괴되거나 이동하는 '스칼라 드리프트' 문제가 발생한다. AI · 머신러닝 · RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
영상 생성 AI의 보상 신호 불안정성, 기준 기반 평가로 해결 Key Point 영상 생성 AI를 강화학습으로 최적화할 때 보상 신호의 불안정성은 학습 효율을 크게 떨어뜨리는데, 명시적 평가 기준을 도입하는 이 접근법이 문제 해결에 새로운 방향을 제시한다.
핵심 요약
영상 생성 모델 강화학습에서 핵심인 보상 모델이 복잡한 영상 품질을 단일 점수로 직접 변환하면서 점수 기준이 프롬프트마다 붕괴되거나 이동하는 '스칼라 드리프트' 문제가 발생한다. RewardVerse는 평가 기준을 동적으로 생성한 후 그에 맞춰 점수를 매기는 방식으로, 명시적 평가 기준을 중간 표현으로 삽입해 점수의 안정성을 높인다. 이를 효율적으로 최적화하기 위해 제안된 Rubric-Guided Policy Optimization(RGPO)는 자기진화 초기 기준으로 평가 모델을 먼저 준비한 후, 기준 생성기와 평가기를 함께 최적화하면서 인간 평가와 정렬하는 2단계 학습 알고리즘이다. 전체 요약 4문장 읽기 → 015 15:11 ▲ 32 · 댓글 3 이미지 생성 모델의 벡터 양자화 학습 안정성 개선 방법 자동회귀 및 마스킹 이미지 생성 모델의 기초가 되는 벡터 양자화(VQ) 토크나이저는 학습 과정이 불안정하다는 문제를 지적했다. AI · 머신러닝 · StableVQ: Practical Guidelines for Stable Vector-Quantized Tokenizer Training
이미지 생성 모델의 벡터 양자화 학습 안정성 개선 방법 Key Point 이미지 생성 모델의 핵심 컴포넌트인 벡터 양자화의 학습 불안정성을 해결하는 실무적 방법론을 제시하므로, 생성형 AI 모델 개발자와 연구자에게 즉시 적용 가능한 지침을 제공한다.
핵심 요약
자동회귀 및 마스킹 이미지 생성 모델의 기초가 되는 벡터 양자화(VQ) 토크나이저는 학습 과정이 불안정하다는 문제를 지적했다. 인코더-디코더와 코드북 학습이 얽혀 있어 두 모듈이 협력할 때만 작동하므로, 학습이 가중될수록 붕괴되는 취약함이 있다. StableVQ는 동적 STE를 통해 인코더의 학습 목표를 안정화하고, 리전 VQ 손실로 코드북이 독립적으로 전체 추적을 보장하며, 분리된 스케줄로 각 모듈이 별도의 학습률을 갖도록 한다. 전체 요약 5문장 읽기 → 016 15:11 ▲ 50 · 댓글 4 3D 일관성을 유지하는 이미지 생성 위한 기하학 기반 잠재공간 기존 생성 모델은 외형만 사실적으로 만들고 3D 구조는 유지하지 못하는데, 이는 표현 문제라고 지적한다. AI · 머신러닝 · GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation
3D 일관성을 유지하는 이미지 생성 위한 기하학 기반 잠재공간 Key Point 생성 모델의 3D 일관성은 학습 방식의 문제가 아니라 잠재공간 자체의 문제라는 새로운 관점을 제시하며, 기하학 정보를 직접 인코딩한 표현 개선으로 생성 품질을 크게 높였다.
핵심 요약
기존 생성 모델은 외형만 사실적으로 만들고 3D 구조는 유지하지 못하는데, 이는 표현 문제라고 지적한다. 기하학 토대 모델의 특징을 재구성한 GAE(기하학-기반 오토인코더)를 제안하며, 이 모델의 잠재공간은 외형·깊이·카메라·포인트맵 모두를 복호화할 수 있다. 동일한 생성기와 학습 방식에서 기존 잠재공간을 GAE로 교체했을 때 시각 품질 지표인 FVD가 12.7~23.1% 개선되고 카메라 궤적 오차는 절반으로 감소했다. 전체 요약 4문장 읽기 → 017 12:11 ▲ 81 · 댓글 4 SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안 자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다. AI · 머신러닝 · RULER: Instance-aware Rubric Rewards for SVG Generation
SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안 Key Point 평가 기준이 없는 개방형 생성 작업에서 인공지능이 보상을 제대로 학습할 수 있는 방법을 제시하며, 이는 코드 생성·이미지 생성 등 다른 창의적 작업의 강화학습에도 적용 가능한 접근방식이다.
핵심 요약
자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다. RULER는 각 지시문을 6개 항목의 인스턴스별 채점 기준표로 변환하고, 비전-언어 모델이 생성된 SVG를 의미·시각·스타일 축으로 항목별 점수를 매겨 보상을 계산한다. 텍스트만으로 채점 기준표를 도출해 SVG 정답 데이터셋이나 인간 선호도 라벨이 필요 없다. 전체 요약 4문장 읽기 → 018 16:18 ▲ 63 · 댓글 3 동영상 생성 AI, 에이전트 학습으로 정확도 19% 향상 비디오 생성 모델이 복잡한 프롬프트를 만족하지 못하는 문제를 해결하기 위해 VideoGen-Agent를 제시했다. AI · 머신러닝 · VideoGen-Agent: Reinforcing Video Generation Agents
동영상 생성 AI, 에이전트 학습으로 정확도 19% 향상 Key Point 비디오 생성 AI가 에이전트 기반 강화학습으로 복잡한 요구사항을 만족하는 방식이 크게 개선되었으며, 추후 생성 도구 발전 시 자동으로 성능 향상을 얻을 수 있다는 점이 중요하다.
핵심 요약
비디오 생성 모델이 복잡한 프롬프트를 만족하지 못하는 문제를 해결하기 위해 VideoGen-Agent를 제시했다. 이 에이전트는 증강·생성·검증 도구를 멀티턴 상호작용으로 조율하며, 프롬프트와 중간 관찰 결과를 바탕으로 의사결정한다. 지도 학습과 강화학습을 거쳐 도구 사용 능력을 개선했고, 카테고리별 균형잡힌 보상으로 평가했다. 전체 요약 6문장 읽기 → 019 16:18 ▲ 32 · 댓글 2 영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개 참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다. AI · 머신러닝 · OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개 Key Point 참조 기반 영상 생성의 평가 기준과 학습 자료가 부족한 상황에서, 34만 개 규모의 산업 수준 데이터셋과 체계적 벤치마크를 제공해 R2V 모델 개발의 표준을 제시한다.
핵심 요약
참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다. 콘텐츠, 모션, 스타일, 구조, 내러티브 등 7개 태스크 패밀리와 18개 세부 과제를 포함하며, 기존 벤치마크보다 다양한 참조 유형과 조합을 다룬다. 12,172개의 체크리스트 항목으로 구성된 '요소 기반 평가'를 도입해 참조 요소의 보존, 분리, 실현 여부를 세밀하게 검증한다. 전체 요약 5문장 읽기 → 020 16:18 ▲ 146 · 댓글 4 비디오 세계 모델 WorldCrafter, 3D 메모리로 긴 시간 일관성 확보 비디오 세계 모델이 장시간 여러 시점에서 일관된 장면을 생성하기 어려운 문제를 해결하는 WorldCrafter 모델을 제시했다. AI · 머신러닝 · WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
비디오 세계 모델 WorldCrafter, 3D 메모리로 긴 시간 일관성 확보 Key Point 비디오 생성 AI의 가장 큰 약점인 시간적 일관성 문제를 3D 메모리 구조로 근본적으로 해결하는 접근법으로, 향후 인터랙티브 비디오 생성 시스템의 품질을 크게 개선할 수 있는 기술이다.
핵심 요약
비디오 세계 모델이 장시간 여러 시점에서 일관된 장면을 생성하기 어려운 문제를 해결하는 WorldCrafter 모델을 제시했다. 요청한 시점에 따라 과거 관찰 데이터를 3D 인식 메모리로 압축해 비디오 생성 모델의 토큰 제약을 효율적으로 활용한다. 메모리 인코더와 포즈 조건 읽기 모듈이 역사 정보를 시점별 토큰으로 통합하되, 명시적 깊이 대응 없이 학습된다. 전체 요약 4문장 읽기 → 021 21:11 당일 +120 중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. AI · 머신러닝 · meituan-longcat/LongCat-Video · Python
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 Key Point 기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다. 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다. 전체 요약 6문장 읽기 → 022 11:10 당일 +181 Open-Sora 2.0, 11B 모델로 고급 영상 생성 완전 공개 Open-Sora는 효율적인 고품질 영상 생성을 모두에게 개방하는 프로젝트이며, 3월 12일 2.0 버전(11B)을 공개했다. AI · 머신러닝 · hpcaitech/Open-Sora · Python
Open-Sora 2.0, 11B 모델로 고급 영상 생성 완전 공개 Key Point 고비용 영상 생성 모델 개발을 오픈소스로 완전 공개하고 학습 비용을 대폭 절감한 방법을 공개했으므로, 누구나 이 기술에 접근할 수 있게 되었다.
핵심 요약
Open-Sora는 효율적인 고품질 영상 생성을 모두에게 개방하는 프로젝트이며, 3월 12일 2.0 버전(11B)을 공개했다. 2.0의 11B 모델은 HunyuanVideo의 11B 모델, Step-Video의 30B 모델과 동등한 수준의 성능을 VBench와 사용자 선호도 평가에서 보여준다. 학습 코드와 체크포인트까지 완전 공개하며, 2억 달러 이상의 높은 학습 비용을 200만 달러 수준으로 절감했다. 전체 요약 5문장 읽기 →