비디오 생성 모델로 로봇 팔 스스로 학습하게 하다
원제 EVO-WAM: Evolving World Action Models through Video-Action Verification
추천 12댓글 1
Key Point
시뮬레이션과 실제 환경 모두에서 로봇 정책 적응 성공률을 2.5배 이상 높이는 새로운 방식이 필요한 상황에서, 외부 데이터 수집 없이 모델 자체의 피드백 루프로 학습하는 접근법을 제시한다.
핵심 요약
- 로봇이 새로운 작업을 배울 때 전문가 시연 데이터 없이 학습하는 문제를 다룬다.
- 월드 액션 모델(WAM)은 비디오와 행동을 함께 예측해 작업 적응의 감독 신호로 쓰이지만, 생성된 영상이 작업 완료를 보여주지 못하거나 영상-행동 불일치로 실행 실패가 발생한다.
- EVO-WAM은 외부 환경 실행 없이 자체 생성 비디오-행동 궤적으로부터 학습해 WAM을 적응시킨다.
- 상태 예측과 고정 다중 프레임 문맥을 추가해 외부 피드백 없이 완전한 자기회귀 롤아웃이 가능하도록 했다.
- 비전-언어 모델로 작업 완료 구간을 선별하고, 역동역학 모델로 비디오-행동 일관성을 검증해 신뢰할 수 있는 학습 데이터를 식별한다.
- 검증된 구간으로 WAM을 반복 학습하고 업데이트된 모델로 새 롤아웃을 생성한다.
- 로봇 시뮬레이션 7개 미숙한 작업에서 Cosmos3 모델의 성공률을 26.9%에서 68.0%로, DreamZero는 28.5%에서 46.4%로 상승시켰다.
- 실제 환경 3개의 긴 수평선 합성 작업에서 Cosmos3의 성공률을 20.0%에서 76.7%로 56.7 포인트 향상시켰다.