인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인
Key Point
저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
- 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다.
- 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다.
- 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다.