쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 10월 2일 (금)까지 1537건
16건 · "비전-언어"조건 지우기 ×
001 03:11 ▲ 24 · 댓글 1 반복 구조로 시각-언어 이해를 깊이있게 처리하는 LoopVL Loop Transformer를 시각-언어 모델로 확장한 LoopVL을 제시한다. AI · 머신러닝 · LoopVL: Recurrent Visual Intelligence
반복 구조로 시각-언어 이해를 깊이있게 처리하는 LoopVL Key Point 반복 구조 기반 비전-언어 모델이 기존 방식보다 더 효율적으로 복잡한 멀티모달 추론을 처리할 수 있음을 실증적으로 보여주는 새로운 아키텍처 패러다임입니다.
핵심 요약
Loop Transformer를 시각-언어 모델로 확장한 LoopVL을 제시한다. Module-Loop와 Model-Loop 연산을 결합하여 공유 모듈을 통해 통합 시각-언어 상태를 반복적으로 업데이트한다. 언어 사전학습, 멀티모달 학습, 포스트 학습 단계를 거쳐 처음부터 훈련했다. 전체 요약 6문장 읽기 → 002 12:11 ▲ 90 · 댓글 2 3D 세계의 이상을 찾아내는 AI 벤치마크 공개 3D 시뮬레이션 환경에서 부유하는 물체, 통과 가능한 벽, 맞지 않는 객체 등의 이상을 자동으로 감지하는 것이 중요해지고 있다. AI · 머신러닝 · WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
3D 세계의 이상을 찾아내는 AI 벤치마크 공개 Key Point 멀티모달 AI가 3D 환경 내 시각적 추론과 행동 탐색을 동시에 수행해야 하는 실제적 요구를 측정하는 벤치마크로, AI 모델의 공간 이해와 의사결정 능력의 격차를 정량화한다.
핵심 요약
3D 시뮬레이션 환경에서 부유하는 물체, 통과 가능한 벽, 맞지 않는 객체 등의 이상을 자동으로 감지하는 것이 중요해지고 있다. 비전-언어 모델(VLM)과 비전-언어-행동 모델(VLA) 같은 멀티모달 AI 시스템이 이 작업을 자동화할 가능성을 보여주고 있다. 3D 세계 감시는 행동 능력(3D 환경을 탐색하며 이상을 체계적으로 찾기)과 시각 추론 능력(환경을 이해하고 이상 식별)의 긴밀한 결합이 필요하다. 전체 요약 8문장 읽기 → 003 06:11 ▲ 11 · 댓글 2 긴 영상 분석 AI의 기억력 문제를 푸는 'VideoLoop' 멀티모달 AI 에이전트가 긴 영상을 이해하려면 여러 추론 단계에서 증거를 반복 수집해야 하는데, 기존 방식은 '의미적 스래싱' 현상을 겪는다. AI · 머신러닝 · VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents
긴 영상 분석 AI의 기억력 문제를 푸는 'VideoLoop' Key Point 긴 영상을 분석하는 AI 에이전트가 정보를 제대로 기억하지 못하는 근본적 문제와 그 해결책을 제시하는 논문으로, 실제 벤치마크에서 10%대의 정확도 차이를 만든다.
핵심 요약
멀티모달 AI 에이전트가 긴 영상을 이해하려면 여러 추론 단계에서 증거를 반복 수집해야 하는데, 기존 방식은 '의미적 스래싱' 현상을 겪는다. '의미적 스래싱'은 작업 메모리가 계속 늘어나면서 핵심 증거에 대한 주의가 흐릿해지고 이미 찾은 정보에 접근할 수 없는 문제다. 연구팀은 추가 전용 메모리가 새로운 대상 증거는 통합할 수 있지만, 누적된 잡음을 제거하거나 컨텍스트 증가를 막으려면 메모리를 재작성하는 기능이 필수임을 수학적으로 보였다. 전체 요약 7문장 읽기 → 004 06:11 ▲ 14 · 댓글 2 이미지 생성으로 추론하기, 멀티모달 LLM 성능 25% 향상 Chain-of-thought 추론은 LLM이 문제를 중간 단계로 분해해 답하도록 하며 자연어 처리를 혁신했지만, 시각 표현의 직접 조작이 필요한 작업에서는 한계를 보인다. AI · 머신러닝 · Reasoning with Image Generation
이미지 생성으로 추론하기, 멀티모달 LLM 성능 25% 향상 Key Point 이미지 생성을 추론 도구로 활용해 멀티모달 LLM 성능을 크게 개선하는 방식을 제시하며, 비전 작업의 새로운 접근법을 보여준다.
핵심 요약
Chain-of-thought 추론은 LLM이 문제를 중간 단계로 분해해 답하도록 하며 자연어 처리를 혁신했지만, 시각 표현의 직접 조작이 필요한 작업에서는 한계를 보인다. 기존 멀티모달 LLM은 깊이 추정·객체 탐지 같은 고정된 좁은 기능의 외부 시각 도구에 의존하며, 이들은 유연하게 시각 콘텐츠를 생성하거나 변환할 수 없다. 연구팀이 제안한 ReImaGin은 이미지 생성 모델을 멀티모달 LLM의 유연한 시각 추론 메커니즘으로 활용하는데, 고정 기능 도구와 달리 자연어 명령을 받아 오클루전 제거나 여러 시점에서 실내 평면도 생성 등 개방형 시각 작업을 수행한다. 전체 요약 4문장 읽기 → 005 18:11 ▲ 27 · 댓글 2 비디오 생성 모델로 로봇 팔 스스로 학습하게 하다 로봇이 새로운 작업을 배울 때 전문가 시연 데이터 없이 학습하는 문제를 다룬다. AI · 머신러닝 · EVO-WAM: Evolving World Action Models through Video-Action Verification
비디오 생성 모델로 로봇 팔 스스로 학습하게 하다 Key Point 시뮬레이션과 실제 환경 모두에서 로봇 정책 적응 성공률을 2.5배 이상 높이는 새로운 방식이 필요한 상황에서, 외부 데이터 수집 없이 모델 자체의 피드백 루프로 학습하는 접근법을 제시한다.
핵심 요약
로봇이 새로운 작업을 배울 때 전문가 시연 데이터 없이 학습하는 문제를 다룬다. 월드 액션 모델(WAM)은 비디오와 행동을 함께 예측해 작업 적응의 감독 신호로 쓰이지만, 생성된 영상이 작업 완료를 보여주지 못하거나 영상-행동 불일치로 실행 실패가 발생한다. EVO-WAM은 외부 환경 실행 없이 자체 생성 비디오-행동 궤적으로부터 학습해 WAM을 적응시킨다. 전체 요약 8문장 읽기 → 006 03:11 ▲ 28 · 댓글 1 흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero 흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다. AI · 머신러닝 · SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero Key Point 방사선학 텍스트의 특성을 고려한 새로운 문장 수준 설계와 거짓 음성 완화 기법이 흉부 X선의 미세조정 없는 분석 성능을 크게 향상시킨다.
핵심 요약
흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다. 최근 문장 수준 접근법이 LLM으로 추출한 임상 구문을 사용해 이를 부분적으로 개선했으나, 방사선학 텍스트의 내재적 특성을 간과하고 양성 쌍의 다양성이 제한되어 있다. 임상적으로 동등한 문장이 환자 간에 반복되면서 대조 학습에서 거짓 음성이 발생하는 문제가 있다. 전체 요약 6문장 읽기 → 007 21:11 ▲ 22 · 댓글 2 Flow Matching으로 이미지 보정 도구 제어하기 기존 이미지 보정 도구는 자동회귀 방식의 대형언어모델로 추론과 도구 선택, 파라미터를 순차적으로 생성했다. AI · 머신러닝 · FlowTool: Controlling Tool Parameter in Image Retouching via Flow Matching
Flow Matching으로 이미지 보정 도구 제어하기 Key Point 자동회귀 방식의 느린 추론을 벗어나 50배 빠른 이미지 보정 시스템을 구현한 새로운 접근 방식으로, 생성형 AI 기반 편집 도구의 성능과 효율성을 크게 개선할 수 있는 경로를 제시한다.
핵심 요약
기존 이미지 보정 도구는 자동회귀 방식의 대형언어모델로 추론과 도구 선택, 파라미터를 순차적으로 생성했다. FlowTool은 이 문제를 Flow Matching으로 재정의하여 입력 이미지와 사용자 지시에 조건부된 고품질 편집 파라미터 분포를 직접 모델링한다. 비전-언어 모델과 Diffusion Transformer 기반 파라미터 생성기를 결합해 가우시안 잡음을 편집 계획으로 변환한다. 전체 요약 8문장 읽기 → 008 21:11 ▲ 35 · 댓글 1 로봇이 실패를 스스로 극복하게 해주는 '수첩' 기법 로보틱스의 핵심 과제는 다양한 작업과 환경에서 조작 능력을 발휘하는 것인데, 비전-언어-행동(VLA) 모델은 실행 중 실패를 진단하고 행동을 적응시켜야 할 때 어려움을 겪는다. AI · 머신러닝 · Recursive Harness Distillation across Agents for Robot Manipulation
로봇이 실패를 스스로 극복하게 해주는 '수첩' 기법 Key Point 로봇 조작의 실패 대응을 자동화하는 방법론이 제시되어, 다양한 환경의 로봇 작업 신뢰도를 크게 높일 수 있는 경로를 보여준다.
핵심 요약
로보틱스의 핵심 과제는 다양한 작업과 환경에서 조작 능력을 발휘하는 것인데, 비전-언어-행동(VLA) 모델은 실행 중 실패를 진단하고 행동을 적응시켜야 할 때 어려움을 겪는다. 연구팀은 강한 에이전트가 약한 에이전트를 위해 경험을 '플레이북'으로 정제하고, 약한 에이전트의 실행 피드백으로 이를 반복 개선하는 '재귀적 하네스 증류(Recursive Harness Distillation)' 기법을 제안했다. 이 플레이북은 모델 파라미터를 업데이트하지 않고도 새로운 작업에서 누적된 개입 지식을 재사용하게 해준다. 전체 요약 6문장 읽기 → 009 15:11 ▲ 18 · 댓글 2 멀티뷰 학습으로 공간 추론 강화한 SpatialSpeak 공개 비전-언어 모델(VLM)이 다중 관점 공간 추론을 위해 기하학적 사전 정보를 활용하지만, 기존 답 위주의 학습은 중간의 기하학적 추정과 정량적 공간 답 도출 과정을 직접 감독하지 않는다. AI · 머신러닝 · SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning
멀티뷰 학습으로 공간 추론 강화한 SpatialSpeak 공개 Key Point 비전-언어 모델의 공간 추론 능력을 크게 향상하는 새로운 학습 방식이 제시되었으며, 멀티뷰 재구성과 사고의 흐름 학습을 결합한 접근법이 기하학적 이해와 답 도출 과정 모두를 강화한다.
핵심 요약
비전-언어 모델(VLM)이 다중 관점 공간 추론을 위해 기하학적 사전 정보를 활용하지만, 기존 답 위주의 학습은 중간의 기하학적 추정과 정량적 공간 답 도출 과정을 직접 감독하지 않는다. 연구팀은 VLM이 멀티뷰 재구성을 통해 국소 기하학과 전역 장면 맥락을 함께 학습할 때 공간 사고의 흐름(CoT) 감독이 더 효과적이라고 가정했다. SpatialSpeak은 두 단계 프레임워크로, 1단계(QA-Native Reconstruction Pretraining, QA-RP)에서 표시된 점 기반 3D 쿼리로 세밀한 국소 기하학을 학습하고 객체 중심 쿼리로 전역 장면 맥락을 학습한다. 전체 요약 8문장 읽기 → 010 15:11 ▲ 91 · 댓글 2 로봇, 코드로 배우고 스스로 진화한다 기존 VLA(비전-언어-동작)·WAM(세계-동작) 모델은 관찰과 지시를 직접 로봇 동작으로 변환하지만, 레이아웃이나 시점이 조금 바뀌어도 실패하고 지시 일반화가 떨어진다. AI · 머신러닝 · Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence
로봇, 코드로 배우고 스스로 진화한다 Key Point 로봇이 코드로 작업 상태를 표현하고 실행 과정을 수정하도록 하면, 환경 변화에 더 탄력적으로 대응하고 장기 작업도 완수할 수 있다는 새로운 접근법을 제시한다.
핵심 요약
기존 VLA(비전-언어-동작)·WAM(세계-동작) 모델은 관찰과 지시를 직접 로봇 동작으로 변환하지만, 레이아웃이나 시점이 조금 바뀌어도 실패하고 지시 일반화가 떨어진다. 근본 원인은 표현 방식에 있다: 작업 요구사항·조건·진행·실패 복구가 동작 수열에 암묵적으로 인코딩돼 검사하거나 수정하기 어렵다. 논문은 디지털 코딩 에이전트의 방식을 물리 로봇에 적용하는 'Physical Coding'을 제안한다: LLM이 도구를 호출하고 결과를 검증한 뒤 피드백으로 실행 가능한 코드를 수정하는 방식이다. 전체 요약 8문장 읽기 → 011 22:26 ▲ 11 · 댓글 2 과거 정보 기억하는 로봇 제어 모델 'MemBodied' 제안 비전-언어-행동 모델은 현재 관찰만으로 로봇 제어를 하는데, 과거 정보가 필요한 조작 작업에서 한계를 보인다. AI · 머신러닝 · MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
과거 정보 기억하는 로봇 제어 모델 'MemBodied' 제안 Key Point 과거 관찰 정보가 필요한 로봇 제어 작업에서 컨텍스트 확장의 비효율성을 해결하면서 매개변수 효율성까지 확보한 새로운 메모리 메커니즘이다.
핵심 요약
비전-언어-행동 모델은 현재 관찰만으로 로봇 제어를 하는데, 과거 정보가 필요한 조작 작업에서 한계를 보인다. 과거 관찰을 컨텍스트에 포함하면 해결되지만 컨텍스트 크기 증가와 추론 지연이라는 문제가 발생한다. MemBodied는 고정 크기의 기억 구조로, 상호작용을 기록하는 연관 상태(associative state)와 초기 장면을 보존하는 에피소드 앵커(episode anchor) 두 개 요소로 구성된다. 전체 요약 8문장 읽기 → 012 12:11 ▲ 81 · 댓글 4 SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안 자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다. AI · 머신러닝 · RULER: Instance-aware Rubric Rewards for SVG Generation
SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안 Key Point 평가 기준이 없는 개방형 생성 작업에서 인공지능이 보상을 제대로 학습할 수 있는 방법을 제시하며, 이는 코드 생성·이미지 생성 등 다른 창의적 작업의 강화학습에도 적용 가능한 접근방식이다.
핵심 요약
자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다. RULER는 각 지시문을 6개 항목의 인스턴스별 채점 기준표로 변환하고, 비전-언어 모델이 생성된 SVG를 의미·시각·스타일 축으로 항목별 점수를 매겨 보상을 계산한다. 텍스트만으로 채점 기준표를 도출해 SVG 정답 데이터셋이나 인간 선호도 라벨이 필요 없다. 전체 요약 4문장 읽기 → 013 16:18 ▲ 29 · 댓글 1 디지털 환경 통합 제어하는 AI 에이전트 MintAct 공개 Hugging Face가 모바일·데스크톱·웹 환경을 통합으로 제어하는 비전-언어 모델 MintAct를 발표했다. AI · 머신러닝 · MintAct: A Unified Visual Agent for Digital Environments
디지털 환경 통합 제어하는 AI 에이전트 MintAct 공개 Key Point 다양한 디지털 환경을 하나의 모델로 제어할 수 있는 AI 에이전트 기술이 실무 수준의 성능에 도달했기에 자동화 애플리케이션 개발에 영향을 미칠 수 있다.
핵심 요약
Hugging Face가 모바일·데스크톱·웹 환경을 통합으로 제어하는 비전-언어 모델 MintAct를 발표했다. 2B부터 8B 규모로 학습된 MintAct는 UI 인식, 다단계 네비게이션, 시각 도구 사용을 한 모델에서 수행한다. 수백 개의 동시 환경 인스턴스와 비동기 강화학습 프레임워크로 도메인 간 학습을 효율화했다. 전체 요약 4문장 읽기 → 014 16:18 ▲ 27 · 댓글 3 인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. AI · 머신러닝 · HuRo: Robotizing Human Videos for Scalable VLA Pretraining
인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 Key Point 저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다. 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다. 015 16:18 ▲ 116 · 댓글 3 비전-언어모델의 지능을 로봇 제어로 옮기다 VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다. 하드웨어 · 시스템 · Transferring the Intelligence of VLMs to Robotic Control
비전-언어모델의 지능을 로봇 제어로 옮기다 Key Point 로봇 제어에 사전학습된 대규모 언어-시각 모델을 직접 활용하는 방식이 과제별 학습 없이도 작동하며, 현실 로봇까지 확대되는 경로를 제시해 로봇공학의 실용화 가능성을 높인다.
핵심 요약
VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다. 소수의 데모로 VLM을 인터페이스 사용법과 작업 전략에 적응시키는 인-컨텍스트 러닝 기법을 도입했다. 작업별 로봇 학습 없이도 강한 성능을 달성하며, 제로샷 설정에서 기존 정책보다 우수하다. 전체 요약 5문장 읽기 → 016 18:10 ▲ 118 · 댓글 15 알리바바, 암 포함 150여 질환 진단하는 의료 AI 모델 공개 알리바바의 연구 부서 Damo Academy가 복부 CT 스캔을 분석해 암을 포함한 약 150개 질환을 진단하는 비전-언어 모델 'Damo Radar'를 오픈소스로 공개했다. AI · 머신러닝 · Alibaba open-sources AI model that can detect cancer and nearly 150 conditions
알리바바, 암 포함 150여 질환 진단하는 의료 AI 모델 공개 Key Point 의료진과 같은 수준의 진단 성능을 갖춘 AI 모델이 오픈소스로 공개되면서, 전 세계 의료기관과 연구자들이 접근할 수 있는 의료 AI의 판도가 바뀔 수 있다.
핵심 요약
알리바바의 연구 부서 Damo Academy가 복부 CT 스캔을 분석해 암을 포함한 약 150개 질환을 진단하는 비전-언어 모델 'Damo Radar'를 오픈소스로 공개했다. 이 모델은 18개 복부 장기를 포괄하고 악성 종양 등 질병과 이상을 식별하도록 설계되었으며, CT 스캔과 임상 보고서 쌍으로 학습했다. 약 4만 건의 실제 진료 검사에서 146개 임상 소견에 걸쳐 평균 AUC(곡선 아래 면적) 0.913을 달성했으며, 1.0은 완벽한 진단 정확도를 의미한다. 전체 요약 4문장 읽기 →