Hugging Face 논문AI · 머신러닝

생성 AI의 시각적 문제해결 능력 평가하는 벤치마크

원제 SolveEdit: Benchmarking Visual Problem Solving in Generative Models

추천 11댓글 1Wenjie Shu, Yexin Liu, Harold Haodong Chen 외
Key Point

생성 AI가 물체 배치, 레이아웃 수정 같은 시각적 목표 달성 문제를 얼마나 잘 풀 수 있는지 체계적으로 평가할 수 있게 되었다.

핵심 요약

  • 기존 벤치마크는 지각, 생성, 명시적 변환만 평가하며 목표 기반의 시각적 문제해결은 평가하지 못했다.
  • SolveEdit은 이미지와 목표가 주어졌을 때 장면을 변환하는 생성 모델의 능력을 평가하는 벤치마크다.
  • 모델은 요청·장면·시각적 규칙에서 유효한 변환을 추론한 뒤 무관한 내용은 보존하면서 실행해야 한다.
  • 2,728개 케이스를 포함하며 원자적 전이 계약(atomic transition contracts)으로 필수·보호 조건을 명시해 단일 참조 출력 없이도 성공도·의도하지 않은 변화를 측정한다.
  • 평가 대상 최강 모델도 SolveScore 57.0%에만 도달했다.
  • SolveEdit-PLAN은 생성 전 시각적 계획을 세우는 2단계 방식으로, 같은 세대의 생성기 3개에서 평균 9.1포인트 향상시켰고 GPT-Image-2는 57.0%에서 71.6%로 올랐다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗