쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 25일 (금)까지1027건
4건 · "비전-언어 모델"조건 지우기 ×
001▲ 10 · 댓글 1로봇 비전-언어 모델에 메모리 장착, 과거 정보 활용 능력 7배 향상로봇 조작 정책(Vision-Language-Action model)이 현재 관찰만 사용해 과거 정보가 필요한 작업을 못 수행하는 문제를 MemBodied로 해결했다.AI · 머신러닝 · MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
로봇 비전-언어 모델에 메모리 장착, 과거 정보 활용 능력 7배 향상

Key Point로봇 조작 작업에서 과거 정보 활용이 필수적인데, 기존 방식은 컨텍스트 길이 증가로 인한 성능 저하 문제가 있었고, MemBodied는 고정 메모리로 이를 효율적으로 해결한 실질적 해법이다.
핵심 요약
- 로봇 조작 정책(Vision-Language-Action model)이 현재 관찰만 사용해 과거 정보가 필요한 작업을 못 수행하는 문제를 MemBodied로 해결했다.
- 고정 크기의 에피소드 메모리를 활용하는데, 정책 호출 간 상호작용을 기록하는 '연관 상태'와 초기 장면의 압축 표현을 보관하는 '에피소드 앵커' 두 가지로 구성된다.
- 컨텍스트 길이를 늘리는 방식과 달리 메모리 크기는 고정해 추론 속도를 유지한다.
- RMBench 작업 5개에서 상태 메모리가 없는 정책 대비 7.81배, 기본 순환 메모리 대비 2.98배 높은 성공률을 달성했다.
- 가장 강력한 메모리 기반 대안 대비 1.3배 우수한 성능을 내면서도 추가 파라미터는 10분의 1 수준이다.
- LIBERO-Long 벤치마크에서 90.6% 성공률로 상태 메모리 없는 기준 정책 대비 5.4% 향상됐다.
002▲ 65 · 댓글 4SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다.AI · 머신러닝 · RULER: Instance-aware Rubric Rewards for SVG Generation
SVG 생성 평가를 위한 '룰렛' 보상 시스템 제안

Key Point평가 기준이 없는 개방형 생성 작업에서 인공지능이 보상을 제대로 학습할 수 있는 방법을 제시하며, 이는 코드 생성·이미지 생성 등 다른 창의적 작업의 강화학습에도 적용 가능한 접근방식이다.
핵심 요약
- 자연언어에서 SVG 코드를 생성하는 작업은 객관적 정답이 없어 기존 스칼라 메트릭(CLIP, Aesthetic)으로 평가하기 어렵고, 이들을 강화학습 보상으로 삼으면 보상 해킹이 발생한다.
- RULER는 각 지시문을 6개 항목의 인스턴스별 채점 기준표로 변환하고, 비전-언어 모델이 생성된 SVG를 의미·시각·스타일 축으로 항목별 점수를 매겨 보상을 계산한다.
- 텍스트만으로 채점 기준표를 도출해 SVG 정답 데이터셋이나 인간 선호도 라벨이 필요 없다.
- MMSVG-Illustration와 MMSVG-Icon 데이터셋에서 성능을 0.432/0.395에서 0.693/0.683으로 향상시켰으며, 전문 SVG 생성 모델을 넘어 더 큰 DeepSeek-V3 수준을 달성했다.
003▲ 29 · 댓글 1디지털 환경 통합 제어하는 AI 에이전트 MintAct 공개Hugging Face가 모바일·데스크톱·웹 환경을 통합으로 제어하는 비전-언어 모델 MintAct를 발표했다.AI · 머신러닝 · MintAct: A Unified Visual Agent for Digital Environments
디지털 환경 통합 제어하는 AI 에이전트 MintAct 공개

Key Point다양한 디지털 환경을 하나의 모델로 제어할 수 있는 AI 에이전트 기술이 실무 수준의 성능에 도달했기에 자동화 애플리케이션 개발에 영향을 미칠 수 있다.
핵심 요약
- Hugging Face가 모바일·데스크톱·웹 환경을 통합으로 제어하는 비전-언어 모델 MintAct를 발표했다.
- 2B부터 8B 규모로 학습된 MintAct는 UI 인식, 다단계 네비게이션, 시각 도구 사용을 한 모델에서 수행한다.
- 수백 개의 동시 환경 인스턴스와 비동기 강화학습 프레임워크로 도메인 간 학습을 효율화했다.
- OSWorld 벤치마크에서 48.9점을 달성하며 영역별 전문 모델과 동등한 성능을 보였다.
004▲ 118 · 댓글 15알리바바, 암 포함 150여 질환 진단하는 의료 AI 모델 공개알리바바의 연구 부서 Damo Academy가 복부 CT 스캔을 분석해 암을 포함한 약 150개 질환을 진단하는 비전-언어 모델 'Damo Radar'를 오픈소스로 공개했다.AI · 머신러닝 · Alibaba open-sources AI model that can detect cancer and nearly 150 conditions
알리바바, 암 포함 150여 질환 진단하는 의료 AI 모델 공개

Key Point의료진과 같은 수준의 진단 성능을 갖춘 AI 모델이 오픈소스로 공개되면서, 전 세계 의료기관과 연구자들이 접근할 수 있는 의료 AI의 판도가 바뀔 수 있다.
핵심 요약
- 알리바바의 연구 부서 Damo Academy가 복부 CT 스캔을 분석해 암을 포함한 약 150개 질환을 진단하는 비전-언어 모델 'Damo Radar'를 오픈소스로 공개했다.
- 이 모델은 18개 복부 장기를 포괄하고 악성 종양 등 질병과 이상을 식별하도록 설계되었으며, CT 스캔과 임상 보고서 쌍으로 학습했다.
- 약 4만 건의 실제 진료 검사에서 146개 임상 소견에 걸쳐 평균 AUC(곡선 아래 면적) 0.913을 달성했으며, 1.0은 완벽한 진단 정확도를 의미한다.
- 연구팀은 이 훈련 방식을 다른 의료 영상 검사 유형으로도 확대할 수 있다고 밝혔으며, 이 모델을 '세계 최초의 전문가 수준 범용 의료 영상 모델'이라고 평가했다.