001 21:11 ▲ 11 · 댓글 3 로봇 조작 실패 복구하는 AI 정책 프레임워크 공개 로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다. AI · 머신러닝 · CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
로봇 조작 실패 복구하는 AI 정책 프레임워크 공개 Key Point 로봇 조작 작업의 안정성을 현저히 높이는 새로운 기법으로, 산업용 로봇이나 자동화 시스템의 신뢰도 문제를 실질적으로 개선할 수 있다.
핵심 요약
로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다. 실제 실패 사례를 수집해 그 패턴을 학습하고, 이를 바탕으로 대표적 실패 상황과 복구 방법을 합성해 훈련시킨다. 추론 시 3D 모니터링으로 실패를 감지하면 작업 진행도를 유지하면서 단계별로 미세 조정하거나 다시 시도한다. 새로운 실패 복구 벤치마크(FSR-Bench)를 공개했으며, 시뮬레이션과 실제 로봇 환경 모두에서 성공률이 평균 14~16%p 상승했다. 코드와 학습 모델, 데이터셋을 깃허브에 공개했다. 002 16:18 ▲ 74 · 댓글 3 로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다. AI · 머신러닝 · Grounded Action Model: 3D Grounding as a Foundation for Robotics
로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다 Key Point 로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.
핵심 요약
기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다. Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다. 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다. RoboTwin 2.0에서 55.3% 성공률을 기록했고(기존 방식 52.0%), 깨끗한 장면 데이터만으로 학습했지만 장면 변화에서 47.6% 성공률을 달성했다(기존 30.4%). LIBERO-PRO 벤치마크에서 61% 성공률로 기존 방식(53%)을 능가했으며, 실제 로봇에서도 시각 변화에 강건해 YAM에서 17/20 성공(기존 4/20)을 기록했다. 높은 수준의 계획자와 결합시 롱호라이즌 작업에서 64.7% ID 완성률과 49.8% OOD 완성률을 달성했다. 003 16:18 ▲ 19 · 댓글 3 인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. AI · 머신러닝 · HuRo: Robotizing Human Videos for Scalable VLA Pretraining
인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 Key Point 저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다. 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다. 004 16:18 ▲ 101 · 댓글 3 비전-언어모델의 지능을 로봇 제어로 옮기다 VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다. 하드웨어 · 시스템 · Transferring the Intelligence of VLMs to Robotic Control
비전-언어모델의 지능을 로봇 제어로 옮기다 Key Point 로봇 제어에 사전학습된 대규모 언어-시각 모델을 직접 활용하는 방식이 과제별 학습 없이도 작동하며, 현실 로봇까지 확대되는 경로를 제시해 로봇공학의 실용화 가능성을 높인다.
핵심 요약
VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다. 소수의 데모로 VLM을 인터페이스 사용법과 작업 전략에 적응시키는 인-컨텍스트 러닝 기법을 도입했다. 작업별 로봇 학습 없이도 강한 성능을 달성하며, 제로샷 설정에서 기존 정책보다 우수하다. RoboTwin 2.0 C2R 벤치마크에서 제로샷 53.2%에서 원샷 73.6%로 성공률이 상승하고, RoboDojo에서도 35.67%에서 47.17%로 향상된다. 동일한 프레임워크가 실제 로봇으로도 옮겨져 Franka 로봇에서 블록 정렬 및 쌓기 작업을 수행한다. 005 06:10 ▲ 122 · 댓글 63 캑터스 니들 3: 8~29MB 경량 모델이 DeepSeek V4 Flash 수준 성능 8~29MB 크기의 경량 자동화 모델 캑터스 니들 3을 공개했습니다. AI · 머신러닝 · Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash
캑터스 니들 3: 8~29MB 경량 모델이 DeepSeek V4 Flash 수준 성능 Key Point 에지 기기 AI의 핵심 병목이던 모델 크기와 성능의 트레이드오프를 근본적으로 바꾸는 아키텍처로, 온디바이스 AI 구현이 현실화될 수 있음을 보여줍니다.
핵심 요약
8~29MB 크기의 경량 자동화 모델 캑터스 니들 3을 공개했습니다. Laddered Simple Attention Networks 아키텍처로 같은 크기 트랜스포머 대비 토큰당 2배 적은 연산을 사용합니다. 4계층 모델을 파인튜닝하면 DeepSeek V4 Flash와 같은 성능을 내며, 라즈베리파이5에서 초당 400~4000토큰을 처리합니다. 함수 호출, 데이터 추출, 텍스트 임베딩을 지원하며 스마트홈, 로봇, 웨어러블 등 임베디드 기기에 적용됩니다. 10배 큰 모델보다 모바일 함수 호출에서, 2~3배 큰 모델과는 데이터 추출에서 더 나은 성능을 보입니다. Python 패키지로 설치 가능하며 HuggingFace에서 추론 엔진을 내려받아 오프라인으로 동작합니다. 006 08:27 ▲ 202 · 댓글 52 물리 AI 연구용 오픈소스 7자유도 로봇팔 OpenArm 공개 OpenArm은 접촉 많은 작업에 최적화된 7DOF 휴머노이드 팔로, 높은 백드라이버빌리티와 컴플라이언스를 갖춰 안전한 인간-로봇 상호작용이 가능하다. 하드웨어 · 시스템 · OpenArm: An open-source 7DOF humanoid arm
물리 AI 연구용 오픈소스 7자유도 로봇팔 OpenArm 공개 Key Point 물리 AI 연구에서 비용 효율적이고 재현 가능한 표준 플랫폼의 부재를 해결하는 오픈소스 솔루션으로, 전 세계 연구팀이 일관된 조건에서 로봇 학습을 진행할 수 있게 한다.
핵심 요약
OpenArm은 접촉 많은 작업에 최적화된 7DOF 휴머노이드 팔로, 높은 백드라이버빌리티와 컴플라이언스를 갖춰 안전한 인간-로봇 상호작용이 가능하다. 완전한 양팔 시스템이 6,500 USD로 제공되며, 텔레오퍼레이션, 모방 학습, 시뮬레이션, 실제 데이터 수집에 활용할 수 있다. OpenArm Cell은 표준화된 환경으로 통일된 배경, 조명, 카메라 배치를 제공해 전 세계에서 일관된 조건으로 연구를 재현 가능하게 한다. 하드웨어는 CERN-OHL-S-2.0 라이선스로 CAD 데이터를 공개하며, ROS2, Isaac Lab, MuJoCo 등 시뮬레이션 환경과 데이터 수집 도구를 함께 제공한다. 007 08:27 ▲ 130 · 댓글 13 경찰, 자동차번판인식 시스템을 장난스럽게 남용하다 미국 경찰들이 Flock의 자동차 번판인식(ALPR) 시스템으로 1,558개 도시의 19,000대 이상 카메라를 검색할 때 'LMAO', 'IDK', 'Hehe' 등 장난스럽거나 무의미한 사유를 기록했다. 보안 · Cops Search Flock Cameras for Reasons of 'LMAO,' 'IDK,' and 'Asdfg'
경찰, 자동차번판인식 시스템을 장난스럽게 남용하다 Key Point 경찰이 대량 감시 시스템에 대한 책임감 없이 접근하고 있으며, 공개 감시 청구 기록이 투명성을 드러낼 수 있음을 보여준다.
핵심 요약
미국 경찰들이 Flock의 자동차 번판인식(ALPR) 시스템으로 1,558개 도시의 19,000대 이상 카메라를 검색할 때 'LMAO', 'IDK', 'Hehe' 등 장난스럽거나 무의미한 사유를 기록했다. EFF 분석에 따르면 경찰들은 '로봇 손가락', 욕설, 무관한 농담까지 검색 사유 칸에 입력했으며, 수만 건의 검색에서는 그냥 '조사', '테스트' 또는 공란으로 남겨뒀다. 영장 요구 없고 감시 장치가 약한 ALPR 시스템은 경찰이 저급 범죄, 개인적 호기심, 때론 심지어 농담 삼아 일반인의 위치 추적을 하도록 조장했다. 뉴스 보도 이후 경찰에 검색 사유를 '최대한 모호하게' 작성하라는 경고가 내려갔고, Flock은 자유로운 입력 대신 드롭다운 메뉴로 변경했다. 기관 감시 체계가 제대로 작동하지 않아 장난스러운 검색을 놓쳤으며, 일부 경찰청은 내부 조사 시효를 이유로 징계하지 않았다. 008 12:10 ▲ 160 · 댓글 125 AI 멸종 위험론, 근거 없는 공포 확산이다 일부 기술 전문가들이 AI가 향후 10년 내 인류를 모두 멸종시킬 확률이 10% 이상이라고 주장하고 있다. AI · 머신러닝 · The contagion of fear
AI 멸종 위험론, 근거 없는 공포 확산이다 Key Point 기술 커뮤니티의 영향력 있는 목소리들이 검증되지 않은 극단적 주장으로 사회적 공포를 조장하는 방식의 문제점을 정면으로 지적한 글로, AI 리스크 논쟁의 근본적 쟁점을 다룬다.
핵심 요약
일부 기술 전문가들이 AI가 향후 10년 내 인류를 모두 멸종시킬 확률이 10% 이상이라고 주장하고 있다. 이들은 '중요 인프라 해킹' '생물무기' 같은 구체적 근거 없이 공포만 조장하는 상태다. 저자는 공포가 증거보다 빠르게 퍼지는 특성을 지적하며, 이는 전문가의 신뢰도를 무기로 한 책임감 없는 공포 확산이라고 비판한다. 물리적 세계에서 로봇이 이런 행동을 실행할 수 있는 능력과 여건은 현재 없으며, 기술 전문가도 이를 인정한다고 주장한다. 저자는 AI 시스템의 물리적 영향력은 인류가 허용하는 범위 내에서만 존재한다고 강조한다. 009 09:10 당일 +124 AI 에이전트용 CAD 설계 자동화 라이브러리 text-to-cad 공개 텍스트 명령으로 3D CAD 모델을 생성·편집하고 STEP, STL, 3MF, GLB 등 다양한 형식으로 내보낼 수 있는 Python 라이브러리다. AI · 머신러닝 · earthtojake/text-to-cad · Python
AI 에이전트용 CAD 설계 자동화 라이브러리 text-to-cad 공개 Key Point CAD와 제조 분야도 LLM 에이전트의 자동화 영역으로 들어오고 있으며, 여러 AI 플랫폼에서 바로 사용 가능한 표준화된 도구가 등장했기 때문이다.
핵심 요약
텍스트 명령으로 3D CAD 모델을 생성·편집하고 STEP, STL, 3MF, GLB 등 다양한 형식으로 내보낼 수 있는 Python 라이브러리다. CAD 작업 외에도 로봇 구조 파일(URDF), 시뮬레이터 모델(SDF), MoveIt2 설정(SRDF) 등 12개 이상의 스킬을 제공한다. 2D DXF 생성, 기성품 부품 검색, 3D 프린팅 검증, G-코드 슬라이싱, Bambu Labs 프린터 제어 등 설계에서 제조까지 전 과정을 자동화할 수 있다. OpenAI Codex, Claude Code, Grok Build 같은 AI 에이전트 플랫폼의 플러그인으로 직접 설치할 수 있으며, Skills CLI로도 관리 가능하다. 010 09:10 ▲ 176 · 댓글 297 자율주행차, 사람보다 훨씬 적게 사고 낸다 미국 보험업체들의 연구로 자동 긴급제동 시스템(AEB)이 보행자 사고를 27%, 후진 충돌을 50% 줄이는 것으로 확인됐다. 하드웨어 · 시스템 · Growing proof that autonomous cars save lives
자율주행차, 사람보다 훨씬 적게 사고 낸다 Key Point 자율주행차의 안전성이 학술적 증거로 뒷받침되면서 규제 승인 움직임이 빨라지고 있는데, 이는 개발자와 정책 담당자 모두에게 이 기술의 상용화 타이밍과 시장 기회를 알려준다.
핵심 요약
미국 보험업체들의 연구로 자동 긴급제동 시스템(AEB)이 보행자 사고를 27%, 후진 충돌을 50% 줄이는 것으로 확인됐다. 웨이모의 로봇택시는 220억 마일 운행 중 사람 운전자 대비 심각한 사고가 92% 적고, 교차로 부상 사고는 96% 감소했다. IIHS의 독립 연구도 같은 결론을 내렸으며, 웨이모 택시의 충돌 사고율이 샌프란시스코 35%, 피닉스 76%, LA 71% 낮았다. 현재 자율주행차는 주·지역별로 규제가 제각각이고 연방 차원의 성능·안전 기준이 없어 비교 평가가 어렵다. 아마존 자회사 주옥스가 NHTSA로부터 첫 안전 기준 면제를 받아 핸들과 페달이 없는 로봇택시 상용화를 추진한다. 011 11:10 ▲ 115 · 댓글 95 로봇 코드 디버깅, LLM이 대신해주길 바랐던 실패기 로봇 코드를 작성하는 개발자가 LLM을 디버깅 어시스턴트로 활용하려 시도했다. AI · 머신러닝 · I'm a seeing-eye dog for a computer
로봇 코드 디버깅, LLM이 대신해주길 바랐던 실패기 Key Point 로봇 코드 개발처럼 시각적 디버깅이 중요한 분야에서 LLM 자동화의 현실적 한계를 드러내므로, 유사한 상황의 개발자들이 참고할 수 있다.
핵심 요약
로봇 코드를 작성하는 개발자가 LLM을 디버깅 어시스턴트로 활용하려 시도했다. 로봇 비주얼라이저 도구와 MCP 서버를 연동해 LLM이 시각적 디버깅을 자동으로 처리하게 하려 했으나, 모델이 정상 작동하는 로봇의 모습을 제대로 이해하지 못했다. GUI 제어 도구의 제약으로 LLM이 올바른 뷰를 찾는 데만 5분이 걸리고, 30분 기다린 결과도 틀렸다. 결국 디버그 뷰어로 직접 문제를 찾은 뒤 스크린샷을 찍어 LLM에 설명하는 방식으로 되돌아갔다. 현재 LLM 기반 비주얼 디버깅은 실무에서 자동화 이점보다 수작업이 빠르다는 결론에 도달했다.