코드로 그리는 이미지·영상, 생성 과정 검증하는 프레임워크
원제 MaLiang-Harness: A Programmable Path to Image and Video Generation
추천 99댓글 1
Key Point
MLLM의 프로그래밍 기반 이미지·영상 생성 능력을 체계적으로 평가하는 첫 벤치마크를 제시하며, 일반 벤치마크로는 예측할 수 없는 시각 생성 성능의 차이를 노출시킨다.
핵심 요약
- 생성 AI가 만든 프로그램이 정상 실행되더라도 요청한 이미지나 영상의 구성·외형·동작이 맞지 않는 문제(Program-to-Visual 갭)를 다룬다.
- MaLiang-Harness는 MLLM이 시각 생성 작업을 구성→검증→수정하는 지속적 과정으로 조직하는 통합 프레임워크다.
- Persistent Executable Generation(PEG)으로 프로그램과 작업 맥락을 유지하고, Traceable Generation Process(TGP)로 편집을 렌더링 결과에 연결하며, Revision-aware Editing and Verification(REV)으로 복원과 검증을 지원한다.
- 11개 폐쇄형 MLLM을 MaLiang-IBench(이미지)와 MaLiang-VBench(영상)에서 평가했으며, 생성 성공률·시각 품질·계산 비용을 측정했다.
- GPT-6-Astra는 두 벤치 모두에서 100% 생성 성공률을 달성했고, 이미지 작업 96.0%, 영상 작업 76.9%가 모든 품질 기준을 충족했다.
- 일반적 능력 점수와 시각 생성 성능 간 불일치가 드러났으며, 비슷한 점수의 모델이 시각 요구사항 만족도에서 크게 달랐다.
- 프로젝트는 GitHub에 공개되어 있다.