생성 AI의 시각적 문제해결 능력 평가하는 벤치마크
원제 SolveEdit: Benchmarking Visual Problem Solving in Generative Models
추천 11댓글 1
Key Point
생성 AI가 물체 배치, 레이아웃 수정 같은 시각적 목표 달성 문제를 얼마나 잘 풀 수 있는지 체계적으로 평가할 수 있게 되었다.
핵심 요약
- 기존 벤치마크는 지각, 생성, 명시적 변환만 평가하며 목표 기반의 시각적 문제해결은 평가하지 못했다.
- SolveEdit은 이미지와 목표가 주어졌을 때 장면을 변환하는 생성 모델의 능력을 평가하는 벤치마크다.
- 모델은 요청·장면·시각적 규칙에서 유효한 변환을 추론한 뒤 무관한 내용은 보존하면서 실행해야 한다.
- 2,728개 케이스를 포함하며 원자적 전이 계약(atomic transition contracts)으로 필수·보호 조건을 명시해 단일 참조 출력 없이도 성공도·의도하지 않은 변화를 측정한다.
- 평가 대상 최강 모델도 SolveScore 57.0%에만 도달했다.
- SolveEdit-PLAN은 생성 전 시각적 계획을 세우는 2단계 방식으로, 같은 세대의 생성기 3개에서 평균 9.1포인트 향상시켰고 GPT-Image-2는 57.0%에서 71.6%로 올랐다.