쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 23일 (수)까지916건
4건 · "VLA"조건 지우기 ×
001▲ 11 · 댓글 3로봇 조작 실패 복구하는 AI 정책 프레임워크 공개로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.AI · 머신러닝 · CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
로봇 조작 실패 복구하는 AI 정책 프레임워크 공개

Key Point로봇 조작 작업의 안정성을 현저히 높이는 새로운 기법으로, 산업용 로봇이나 자동화 시스템의 신뢰도 문제를 실질적으로 개선할 수 있다.
핵심 요약
- 로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다.
- 실제 실패 사례를 수집해 그 패턴을 학습하고, 이를 바탕으로 대표적 실패 상황과 복구 방법을 합성해 훈련시킨다.
- 추론 시 3D 모니터링으로 실패를 감지하면 작업 진행도를 유지하면서 단계별로 미세 조정하거나 다시 시도한다.
- 새로운 실패 복구 벤치마크(FSR-Bench)를 공개했으며, 시뮬레이션과 실제 로봇 환경 모두에서 성공률이 평균 14~16%p 상승했다.
- 코드와 학습 모델, 데이터셋을 깃허브에 공개했다.
002▲ 74 · 댓글 3로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.AI · 머신러닝 · Grounded Action Model: 3D Grounding as a Foundation for Robotics
로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다

Key Point로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.
핵심 요약
- 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.
- Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다.
- 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다.
- RoboTwin 2.0에서 55.3% 성공률을 기록했고(기존 방식 52.0%), 깨끗한 장면 데이터만으로 학습했지만 장면 변화에서 47.6% 성공률을 달성했다(기존 30.4%).
- LIBERO-PRO 벤치마크에서 61% 성공률로 기존 방식(53%)을 능가했으며, 실제 로봇에서도 시각 변화에 강건해 YAM에서 17/20 성공(기존 4/20)을 기록했다.
- 높은 수준의 계획자와 결합시 롱호라이즌 작업에서 64.7% ID 완성률과 49.8% OOD 완성률을 달성했다.
003▲ 19 · 댓글 3인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다.AI · 머신러닝 · HuRo: Robotizing Human Videos for Scalable VLA Pretraining
인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인

Key Point저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
- 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다.
- 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다.
- 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다.
004▲ 105 · 댓글 26샘플 음악으로 미국 문화 비판하는 네거틀랜드의 46년1980년 창립한 실험음악 집단 네거틀랜드는 샘플링과 발견된 자료를 혼합한 '컬처 재밍' 기법으로 30개 이상의 음반과 라디오 프로그램을 제작했다.기타 · Negativland, Culture Jamming, and the Art of Making Something New
샘플 음악으로 미국 문화 비판하는 네거틀랜드의 46년
Key Point저작권 개혁을 주도한 예술 집단의 46년 활동 경로와 샘플링 미술의 법적·창작적 정당성이 어떻게 변화해왔는지 보여준다.
핵심 요약
- 1980년 창립한 실험음악 집단 네거틀랜드는 샘플링과 발견된 자료를 혼합한 '컬처 재밍' 기법으로 30개 이상의 음반과 라디오 프로그램을 제작했다.
- 1991년 U2의 곡을 샘플링한 음반으로 저작권 침해 소송을 당했으나, 이를 계기로 미국 저작권 개혁 필요성을 알리고 1995년 '공정한 사용' 관련 책을 출판했다.
- 1981년부터 방송된 '오버 더 엣지' 라디오 프로그램은 인터넷 아카이브와 협력하여 4000시간 이상이 무료로 보존·공개되고 있다.
- 멤버들은 의도적으로 음반에 얼굴 사진을 싣지 않으며, 46년간 권력·돈·자본주의·미디어 통제 같은 주제로 '이상한 평행 우주'를 표현해왔다.
- 9월 16일 샌프란시스코 인터넷 아카이브 본부에서 원격 협력 공연을 열며, 마크 호슬러는 1985년부터의 협력자 조 레이데커와 함께 무대에 선다.