쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1537건
4건 · "시각 추론"조건 지우기 ×
001▲ 24 · 댓글 1반복 구조로 시각-언어 이해를 깊이있게 처리하는 LoopVLLoop Transformer를 시각-언어 모델로 확장한 LoopVL을 제시한다.AI · 머신러닝 · LoopVL: Recurrent Visual Intelligence
반복 구조로 시각-언어 이해를 깊이있게 처리하는 LoopVL

Key Point반복 구조 기반 비전-언어 모델이 기존 방식보다 더 효율적으로 복잡한 멀티모달 추론을 처리할 수 있음을 실증적으로 보여주는 새로운 아키텍처 패러다임입니다.
핵심 요약
- Loop Transformer를 시각-언어 모델로 확장한 LoopVL을 제시한다.
- Module-Loop와 Model-Loop 연산을 결합하여 공유 모듈을 통해 통합 시각-언어 상태를 반복적으로 업데이트한다.
- 언어 사전학습, 멀티모달 학습, 포스트 학습 단계를 거쳐 처음부터 훈련했다.
전체 요약 6문장 읽기 → 002▲ 202 · 댓글 1멀티모달 AI의 숨은 추론 과정, 시각 증거로 감시한다멀티모달 대형언어모델(MLLM)이 추론 과정을 숨겨진 토큰(latent token)으로 수행하는 방식(LVR)이 확산되고 있지만, 이 과정을 직접 관찰할 수 없어 학습을 감독하기 어렵다.AI · 머신러닝 · Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence
멀티모달 AI의 숨은 추론 과정, 시각 증거로 감시한다

Key Point멀티모달 AI가 추론하는 과정을 들여다보고 통제하는 방법이 나왔으며, 초대형 모델까지 확장 가능함을 증명했기 때문이다.
핵심 요약
- 멀티모달 대형언어모델(MLLM)이 추론 과정을 숨겨진 토큰(latent token)으로 수행하는 방식(LVR)이 확산되고 있지만, 이 과정을 직접 관찰할 수 없어 학습을 감독하기 어렵다.
- 연구팀이 토큰 동작을 분석한 결과, 이미지 변형으로 정답이 바뀌어도 토큰이 약한 반응만 보이는 '증거-신용 격차(evidence-credit gap)' 문제를 발견했다.
- GRPO 훈련 중 명시적 감독이 부족해서 생기는 문제로, 최종 답변에 대한 보상만으로는 어떤 시각 정보를 보존할지, 신용을 어떻게 배치할지 제대로 지도할 수 없음을 보여주었다.
전체 요약 8문장 읽기 → 003▲ 90 · 댓글 23D 세계의 이상을 찾아내는 AI 벤치마크 공개3D 시뮬레이션 환경에서 부유하는 물체, 통과 가능한 벽, 맞지 않는 객체 등의 이상을 자동으로 감지하는 것이 중요해지고 있다.AI · 머신러닝 · WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
3D 세계의 이상을 찾아내는 AI 벤치마크 공개

Key Point멀티모달 AI가 3D 환경 내 시각적 추론과 행동 탐색을 동시에 수행해야 하는 실제적 요구를 측정하는 벤치마크로, AI 모델의 공간 이해와 의사결정 능력의 격차를 정량화한다.
핵심 요약
- 3D 시뮬레이션 환경에서 부유하는 물체, 통과 가능한 벽, 맞지 않는 객체 등의 이상을 자동으로 감지하는 것이 중요해지고 있다.
- 비전-언어 모델(VLM)과 비전-언어-행동 모델(VLA) 같은 멀티모달 AI 시스템이 이 작업을 자동화할 가능성을 보여주고 있다.
- 3D 세계 감시는 행동 능력(3D 환경을 탐색하며 이상을 체계적으로 찾기)과 시각 추론 능력(환경을 이해하고 이상 식별)의 긴밀한 결합이 필요하다.
전체 요약 8문장 읽기 → 004▲ 14 · 댓글 2이미지 생성으로 추론하기, 멀티모달 LLM 성능 25% 향상Chain-of-thought 추론은 LLM이 문제를 중간 단계로 분해해 답하도록 하며 자연어 처리를 혁신했지만, 시각 표현의 직접 조작이 필요한 작업에서는 한계를 보인다.AI · 머신러닝 · Reasoning with Image Generation
이미지 생성으로 추론하기, 멀티모달 LLM 성능 25% 향상

Key Point이미지 생성을 추론 도구로 활용해 멀티모달 LLM 성능을 크게 개선하는 방식을 제시하며, 비전 작업의 새로운 접근법을 보여준다.
핵심 요약
- Chain-of-thought 추론은 LLM이 문제를 중간 단계로 분해해 답하도록 하며 자연어 처리를 혁신했지만, 시각 표현의 직접 조작이 필요한 작업에서는 한계를 보인다.
- 기존 멀티모달 LLM은 깊이 추정·객체 탐지 같은 고정된 좁은 기능의 외부 시각 도구에 의존하며, 이들은 유연하게 시각 콘텐츠를 생성하거나 변환할 수 없다.
- 연구팀이 제안한 ReImaGin은 이미지 생성 모델을 멀티모달 LLM의 유연한 시각 추론 메커니즘으로 활용하는데, 고정 기능 도구와 달리 자연어 명령을 받아 오클루전 제거나 여러 시점에서 실내 평면도 생성 등 개방형 시각 작업을 수행한다.
전체 요약 4문장 읽기 →