Hugging Face 논문AI · 머신러닝오늘의 주요

코드로 그리는 이미지·영상, 생성 과정 검증하는 프레임워크

원제 MaLiang-Harness: A Programmable Path to Image and Video Generation

추천 99댓글 1Haoyu Zhao, Zihao Zhang, Xudong Wang 외
Key Point

MLLM의 프로그래밍 기반 이미지·영상 생성 능력을 체계적으로 평가하는 첫 벤치마크를 제시하며, 일반 벤치마크로는 예측할 수 없는 시각 생성 성능의 차이를 노출시킨다.

핵심 요약

  • 생성 AI가 만든 프로그램이 정상 실행되더라도 요청한 이미지나 영상의 구성·외형·동작이 맞지 않는 문제(Program-to-Visual 갭)를 다룬다.
  • MaLiang-Harness는 MLLM이 시각 생성 작업을 구성→검증→수정하는 지속적 과정으로 조직하는 통합 프레임워크다.
  • Persistent Executable Generation(PEG)으로 프로그램과 작업 맥락을 유지하고, Traceable Generation Process(TGP)로 편집을 렌더링 결과에 연결하며, Revision-aware Editing and Verification(REV)으로 복원과 검증을 지원한다.
  • 11개 폐쇄형 MLLM을 MaLiang-IBench(이미지)와 MaLiang-VBench(영상)에서 평가했으며, 생성 성공률·시각 품질·계산 비용을 측정했다.
  • GPT-6-Astra는 두 벤치 모두에서 100% 생성 성공률을 달성했고, 이미지 작업 96.0%, 영상 작업 76.9%가 모든 품질 기준을 충족했다.
  • 일반적 능력 점수와 시각 생성 성능 간 불일치가 드러났으며, 비슷한 점수의 모델이 시각 요구사항 만족도에서 크게 달랐다.
  • 프로젝트는 GitHub에 공개되어 있다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗