쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 26일 (토)까지1085건
4건 · "로봇 조작"조건 지우기 ×
001▲ 13 · 댓글 2로봇 시각-언어 모델의 안전성 강화, HJ 도달가능성 기반 셰일드VLA 제안로봇 조작·이동을 수행하는 VLA(Vision-Language-Action) 모델은 일반화 성능이 뛰어나지만 기존 미세조정 방식은 안전성 보장이 부족하다.AI · 머신러닝 · ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models
로봇 시각-언어 모델의 안전성 강화, HJ 도달가능성 기반 셰일드VLA 제안

Key Point로봇 AI 모델의 안전성은 실제 배포 시 가장 중요한 과제이며, ShieldVLA는 기존 트레이드오프 방식을 근본적으로 개선하는 새로운 접근법을 제시한다.
핵심 요약
- 로봇 조작·이동을 수행하는 VLA(Vision-Language-Action) 모델은 일반화 성능이 뛰어나지만 기존 미세조정 방식은 안전성 보장이 부족하다.
- 현재 방식은 라그랑주 최적화로 누적 비용에 소프트 페널티를 부과하는데, 이는 제약 위반이나 과도하게 보수적 행동을 초래하고 시각 도메인에서 단계별 안전 레이블이 없어 학습이 어렵다.
- Hamilton-Jacobi(HJ) 도달가능성에 기반한 ShieldVLA를 제안하며, 시각 관찰로부터 HJ 도달가능성 가치함수를 모델-프리 방식으로 근사하여 안전 작동 영역을 추정한다.
전체 요약 6문장 읽기 → 002▲ 11 · 댓글 2로봇 조작용 변형 물체를 AI로 자동 생성하는 DeformSmithDeformSmith는 텍스트나 단일 이미지에서 로봇 조작에 적합한 변형 가능한 3D 물체(asset)를 자동으로 생성하는 프레임워크다.AI · 머신러닝 · DeformSmith: Physics Harness-Guided Hierarchical Generation of Deformable Assets for Robot Manipulation
로봇 조작용 변형 물체를 AI로 자동 생성하는 DeformSmith

Key Point로봇 조작 연구에서 현실적인 변형 물체 데이터를 얻기 위해 필요한 자동 생성 기술이 어떻게 동작하고 기존 방법과 구별되는지 알 수 있다.
핵심 요약
- DeformSmith는 텍스트나 단일 이미지에서 로봇 조작에 적합한 변형 가능한 3D 물체(asset)를 자동으로 생성하는 프레임워크다.
- 기존 방식의 어려움은 변형 물체의 기하학, 외형, 물리 속성을 동시에 정해야 하는데, 텍스트와 이미지만으로는 접촉 변형 거동을 충분히 표현할 수 없다는 것이다.
- 이 프레임워크는 계층적 에이전트 구성과 공유 물리 기반 '하네스(harness)'를 사용해, 기하학·물리 모델·재질 거동·로봇 상호작용을 단계별로 구축·테스트·정제한다.
전체 요약 6문장 읽기 → 003▲ 24 · 댓글 3로봇 조작 실패 복구하는 AI 정책 프레임워크 공개로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.AI · 머신러닝 · CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
로봇 조작 실패 복구하는 AI 정책 프레임워크 공개

Key Point로봇 조작 작업의 안정성을 현저히 높이는 새로운 기법으로, 산업용 로봇이나 자동화 시스템의 신뢰도 문제를 실질적으로 개선할 수 있다.
핵심 요약
- 로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.
- 실제 실패 사례를 수집해 그 패턴을 학습하고, 이를 바탕으로 대표적 실패 상황과 복구 방법을 합성해 훈련시킨다.
- 추론 시 3D 모니터링으로 실패를 감지하면 작업 진행도를 유지하면서 단계별로 미세 조정하거나 다시 시도한다.
전체 요약 5문장 읽기 → 004▲ 84 · 댓글 3로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.AI · 머신러닝 · Grounded Action Model: 3D Grounding as a Foundation for Robotics
로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다

Key Point로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.
핵심 요약
- 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.
- Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다.
- 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다.
전체 요약 6문장 읽기 →