이미지 생성 AI로 GUI 상호작용 데이터 합성
원제 AutoGUIWorld: Image Generators as Visual World Models for GUI Agent
추천 43댓글 2
Key Point
GUI 에이전트 학습 비용을 획기적으로 줄일 수 있는 데이터 합성 방법이 실제 환경에서 성능 향상을 입증했기 때문이다.
핵심 요약
- GUI 에이전트 학습에는 소프트웨어 환경과의 상호작용 궤적이 필요하지만, 실제 앱을 설치·운영하면서 수집하는 방식은 비용이 많이 든다.
- AutoGUIWorld는 이미지 생성 모델과 작업 계획기를 결합해 실제 환경을 배포하지 않고도 GUI 상호작용 데이터를 자동으로 생성하는 프레임워크다.
- 초기 GUI 화면을 운영체제 컨텍스트·시각적 모양·인터페이스 상태로 정의한 후, 조건부 작업을 생성한다.
- 계획기가 원자적 행동과 의도한 시각적 결과를 지정하고, 이미지 생성 모델이 스크린샷을 반복 편집해 다음 상태를 생성한다.
- 행동 근거화와 필터링을 거쳐 Ubuntu·Windows·macOS·Chrome에서 79,266개의 단계별 공간 주석이 달린 학습 샘플을 확보했다.
- Qwen3.5-35B-A3B를 AutoGUIWorld 궤적으로 파인튜닝한 결과, OSWorld 평균 점수가 33.0%에서 40.8%로 상승했고, ScienceBoard 성공률은 14.0%에서 32.2%로 향상됐다.
- 생성된 궤적이 실제 데스크톱 및 과학 작업에서 GUI 에이전트 성능을 개선함을 보였다.