로봇 안전 정렬 위한 VLA 미세조정 프레임워크 ShieldVLA 공개
원제 ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models
추천 13댓글 2
Key Point
로봇 제어 시스템에서 안전 정렬과 작업 성공률을 동시에 달성하는 방법이 제시되었으며, 수동 라벨링 없이 확장 가능한 감독 방식이 실제 적용 장벽을 낮춘다.
핵심 요약
- 비전-언어-행동(VLA) 모델의 기존 미세조정 방식은 안전 보장이 제한적이며, 라그랑주 최적화는 보상-비용 상충을 완전히 해결하지 못한다.
- ShieldVLA는 Hamilton-Jacobi 도달 가능성(HJ reachability) 기반 프레임워크로, 시각 관찰으로부터 모델 무관의 도달 가능성 함수를 학습해 안전 작동 영역을 추정한다.
- 학습된 안전 비평가(safety critic)가 보상 최대화와 위험 상태 회복을 분리함으로써 지속적인 보상-비용 상충을 피한다.
- 시각 환경에서 확장 가능한 감독을 위해 VLM 안전 점수를 사용해 수동 비용 레이블 없이 비평가 목표를 생성한다.
- 5개 네비게이션·조작 벤치마크에서 ShieldVLA는 누적 안전 비용을 평균 57% 줄였고 SafeVLA 대비 작업 성공률을 +0.13 향상시켰다.