Hugging Face 논문AI · 머신러닝

이미지 생성 AI로 GUI 상호작용 데이터 합성

원제 AutoGUIWorld: Image Generators as Visual World Models for GUI Agent

추천 43댓글 2Cheng Yang, Yifan Wu, Yutao Huang 외
Key Point

GUI 에이전트 학습 비용을 획기적으로 줄일 수 있는 데이터 합성 방법이 실제 환경에서 성능 향상을 입증했기 때문이다.

핵심 요약

  • GUI 에이전트 학습에는 소프트웨어 환경과의 상호작용 궤적이 필요하지만, 실제 앱을 설치·운영하면서 수집하는 방식은 비용이 많이 든다.
  • AutoGUIWorld는 이미지 생성 모델과 작업 계획기를 결합해 실제 환경을 배포하지 않고도 GUI 상호작용 데이터를 자동으로 생성하는 프레임워크다.
  • 초기 GUI 화면을 운영체제 컨텍스트·시각적 모양·인터페이스 상태로 정의한 후, 조건부 작업을 생성한다.
  • 계획기가 원자적 행동과 의도한 시각적 결과를 지정하고, 이미지 생성 모델이 스크린샷을 반복 편집해 다음 상태를 생성한다.
  • 행동 근거화와 필터링을 거쳐 Ubuntu·Windows·macOS·Chrome에서 79,266개의 단계별 공간 주석이 달린 학습 샘플을 확보했다.
  • Qwen3.5-35B-A3B를 AutoGUIWorld 궤적으로 파인튜닝한 결과, OSWorld 평균 점수가 33.0%에서 40.8%로 상승했고, ScienceBoard 성공률은 14.0%에서 32.2%로 향상됐다.
  • 생성된 궤적이 실제 데스크톱 및 과학 작업에서 GUI 에이전트 성능을 개선함을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗