Hugging Face 논문AI · 머신러닝오늘의 주요

로봇 안전 정렬 위한 VLA 미세조정 프레임워크 ShieldVLA 공개

원제 ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models

추천 13댓글 2Manan Tayal, Akshay Nambi
Key Point

로봇 제어 시스템에서 안전 정렬과 작업 성공률을 동시에 달성하는 방법이 제시되었으며, 수동 라벨링 없이 확장 가능한 감독 방식이 실제 적용 장벽을 낮춘다.

핵심 요약

  • 비전-언어-행동(VLA) 모델의 기존 미세조정 방식은 안전 보장이 제한적이며, 라그랑주 최적화는 보상-비용 상충을 완전히 해결하지 못한다.
  • ShieldVLA는 Hamilton-Jacobi 도달 가능성(HJ reachability) 기반 프레임워크로, 시각 관찰으로부터 모델 무관의 도달 가능성 함수를 학습해 안전 작동 영역을 추정한다.
  • 학습된 안전 비평가(safety critic)가 보상 최대화와 위험 상태 회복을 분리함으로써 지속적인 보상-비용 상충을 피한다.
  • 시각 환경에서 확장 가능한 감독을 위해 VLM 안전 점수를 사용해 수동 비용 레이블 없이 비평가 목표를 생성한다.
  • 5개 네비게이션·조작 벤치마크에서 ShieldVLA는 누적 안전 비용을 평균 57% 줄였고 SafeVLA 대비 작업 성공률을 +0.13 향상시켰다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗