쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 25일 (금)까지1027건
3건 · "로봇 제어"조건 지우기 ×
001▲ 10 · 댓글 1로봇 비전-언어 모델에 메모리 장착, 과거 정보 활용 능력 7배 향상로봇 조작 정책(Vision-Language-Action model)이 현재 관찰만 사용해 과거 정보가 필요한 작업을 못 수행하는 문제를 MemBodied로 해결했다.AI · 머신러닝 · MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
로봇 비전-언어 모델에 메모리 장착, 과거 정보 활용 능력 7배 향상

Key Point로봇 조작 작업에서 과거 정보 활용이 필수적인데, 기존 방식은 컨텍스트 길이 증가로 인한 성능 저하 문제가 있었고, MemBodied는 고정 메모리로 이를 효율적으로 해결한 실질적 해법이다.
핵심 요약
- 로봇 조작 정책(Vision-Language-Action model)이 현재 관찰만 사용해 과거 정보가 필요한 작업을 못 수행하는 문제를 MemBodied로 해결했다.
- 고정 크기의 에피소드 메모리를 활용하는데, 정책 호출 간 상호작용을 기록하는 '연관 상태'와 초기 장면의 압축 표현을 보관하는 '에피소드 앵커' 두 가지로 구성된다.
- 컨텍스트 길이를 늘리는 방식과 달리 메모리 크기는 고정해 추론 속도를 유지한다.
- RMBench 작업 5개에서 상태 메모리가 없는 정책 대비 7.81배, 기본 순환 메모리 대비 2.98배 높은 성공률을 달성했다.
- 가장 강력한 메모리 기반 대안 대비 1.3배 우수한 성능을 내면서도 추가 파라미터는 10분의 1 수준이다.
- LIBERO-Long 벤치마크에서 90.6% 성공률로 상태 메모리 없는 기준 정책 대비 5.4% 향상됐다.
002▲ 13 · 댓글 2로봇 안전 정렬 위한 VLA 미세조정 프레임워크 ShieldVLA 공개비전-언어-행동(VLA) 모델의 기존 미세조정 방식은 안전 보장이 제한적이며, 라그랑주 최적화는 보상-비용 상충을 완전히 해결하지 못한다.AI · 머신러닝 · ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models
로봇 안전 정렬 위한 VLA 미세조정 프레임워크 ShieldVLA 공개

Key Point로봇 제어 시스템에서 안전 정렬과 작업 성공률을 동시에 달성하는 방법이 제시되었으며, 수동 라벨링 없이 확장 가능한 감독 방식이 실제 적용 장벽을 낮춘다.
핵심 요약
- 비전-언어-행동(VLA) 모델의 기존 미세조정 방식은 안전 보장이 제한적이며, 라그랑주 최적화는 보상-비용 상충을 완전히 해결하지 못한다.
- ShieldVLA는 Hamilton-Jacobi 도달 가능성(HJ reachability) 기반 프레임워크로, 시각 관찰으로부터 모델 무관의 도달 가능성 함수를 학습해 안전 작동 영역을 추정한다.
- 학습된 안전 비평가(safety critic)가 보상 최대화와 위험 상태 회복을 분리함으로써 지속적인 보상-비용 상충을 피한다.
- 시각 환경에서 확장 가능한 감독을 위해 VLM 안전 점수를 사용해 수동 비용 레이블 없이 비평가 목표를 생성한다.
- 5개 네비게이션·조작 벤치마크에서 ShieldVLA는 누적 안전 비용을 평균 57% 줄였고 SafeVLA 대비 작업 성공률을 +0.13 향상시켰다.
003▲ 116 · 댓글 3비전-언어모델의 지능을 로봇 제어로 옮기다VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다.하드웨어 · 시스템 · Transferring the Intelligence of VLMs to Robotic Control
비전-언어모델의 지능을 로봇 제어로 옮기다

Key Point로봇 제어에 사전학습된 대규모 언어-시각 모델을 직접 활용하는 방식이 과제별 학습 없이도 작동하며, 현실 로봇까지 확대되는 경로를 제시해 로봇공학의 실용화 가능성을 높인다.
핵심 요약
- VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다.
- 소수의 데모로 VLM을 인터페이스 사용법과 작업 전략에 적응시키는 인-컨텍스트 러닝 기법을 도입했다.
- 작업별 로봇 학습 없이도 강한 성능을 달성하며, 제로샷 설정에서 기존 정책보다 우수하다.
- RoboTwin 2.0 C2R 벤치마크에서 제로샷 53.2%에서 원샷 73.6%로 성공률이 상승하고, RoboDojo에서도 35.67%에서 47.17%로 향상된다.
- 동일한 프레임워크가 실제 로봇으로도 옮겨져 Franka 로봇에서 블록 정렬 및 쌓기 작업을 수행한다.