로봇 시각-언어 모델의 안전성 강화, HJ 도달가능성 기반 셰일드VLA 제안
Key Point
로봇 AI 모델의 안전성은 실제 배포 시 가장 중요한 과제이며, ShieldVLA는 기존 트레이드오프 방식을 근본적으로 개선하는 새로운 접근법을 제시한다.
핵심 요약
- 로봇 조작·이동을 수행하는 VLA(Vision-Language-Action) 모델은 일반화 성능이 뛰어나지만 기존 미세조정 방식은 안전성 보장이 부족하다.
- 현재 방식은 라그랑주 최적화로 누적 비용에 소프트 페널티를 부과하는데, 이는 제약 위반이나 과도하게 보수적 행동을 초래하고 시각 도메인에서 단계별 안전 레이블이 없어 학습이 어렵다.
- Hamilton-Jacobi(HJ) 도달가능성에 기반한 ShieldVLA를 제안하며, 시각 관찰로부터 HJ 도달가능성 가치함수를 모델-프리 방식으로 근사하여 안전 작동 영역을 추정한다.