쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 10월 2일 (금)까지 1562건
6건 · "Vision-Language"조건 지우기 ×
001 21:11 ▲ 36 · 댓글 2 이미지 유무가 판단을 휘흔든다, VLM 평가의 숨은 함정 VLM(시각-언어 모델)이 인간 평가자 대신 사용되면서, 평가 환경 자체가 모델 성능에 미치는 영향을 검증해야 한다는 문제 제기. AI · 머신러닝 · It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them
이미지 유무가 판단을 휘흔든다, VLM 평가의 숨은 함정 Key Point VLM을 평가자로 대체할 때 지침 준수 여부가 아니라 평가 환경 자체가 판단을 흔드는 것으로 나타나, 모델 능력 평가의 신뢰성을 다시 생각해야 한다.
핵심 요약
VLM(시각-언어 모델)이 인간 평가자 대신 사용되면서, 평가 환경 자체가 모델 성능에 미치는 영향을 검증해야 한다는 문제 제기. 연구팀이 MIST(Misleading-Image Stress Test)라는 테스트 세트를 개발했다: 비유와 문자적 의미로 해석 가능한 영문 문장 200개씩, 각 문장마다 일치 이미지, 반대 이미지, 이미지 없음 세 가지 조건으로 평가했다. 지침상 이미지는 무시하고 문장만으로 판단해야 했다. 전체 요약 8문장 읽기 → 002 03:11 ▲ 28 · 댓글 1 흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero 흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다. AI · 머신러닝 · SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero Key Point 방사선학 텍스트의 특성을 고려한 새로운 문장 수준 설계와 거짓 음성 완화 기법이 흉부 X선의 미세조정 없는 분석 성능을 크게 향상시킨다.
핵심 요약
흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다. 최근 문장 수준 접근법이 LLM으로 추출한 임상 구문을 사용해 이를 부분적으로 개선했으나, 방사선학 텍스트의 내재적 특성을 간과하고 양성 쌍의 다양성이 제한되어 있다. 임상적으로 동등한 문장이 환자 간에 반복되면서 대조 학습에서 거짓 음성이 발생하는 문제가 있다. 전체 요약 6문장 읽기 → 003 18:11 ▲ 12 · 댓글 1 프로그램 검증으로 강화한 시각-언어 모델 자가학습 시각-언어 모델의 자가학습은 라벨 없는 이미지에서 생성한 질문으로 학습하는데, 기존 방식은 다수결 투표나 모델 심판으로 답을 결정하면서 24~18% 오류율을 낳고 있다. AI · 머신러닝 · Program-Verified Self-Evolution for Vision-Language Models
프로그램 검증으로 강화한 시각-언어 모델 자가학습 Key Point 라벨 없는 데이터로 자가학습하는 모델의 답 검증 정확도를 다수결 투표 76%에서 94%로 끌어올린 방법론이므로, 대규모 비지도 학습 시대에 레이블 수집 비용과 오류 문제를 해결하는 접근법으로 주목할 만하다.
핵심 요약
시각-언어 모델의 자가학습은 라벨 없는 이미지에서 생성한 질문으로 학습하는데, 기존 방식은 다수결 투표나 모델 심판으로 답을 결정하면서 24~18% 오류율을 낳고 있다. 이를 해결하기 위해 VQS(Verifiable QA Generation for Self-Evolving Models)는 답변 검증 방식을 바꿔서, 이미지를 장면그래프·차트·다이어그램 같은 구조화된 기록으로 파싱한 뒤 고정된 프로그램이 질문과 답을 생성한다. 모델은 프로그램이 읽은 개별 사실을 주장 단위로 확인하는 시각 검증자 역할을 하며, 이러한 주장 수준의 검증이 파서의 학습 목표를 선택하므로 파서도 라벨 없이 개선된다. 전체 요약 7문장 읽기 → 004 22:26 ▲ 13 · 댓글 2 로봇 시각-언어 모델의 안전성 강화, HJ 도달가능성 기반 셰일드VLA 제안 로봇 조작·이동을 수행하는 VLA(Vision-Language-Action) 모델은 일반화 성능이 뛰어나지만 기존 미세조정 방식은 안전성 보장이 부족하다. AI · 머신러닝 · ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models
로봇 시각-언어 모델의 안전성 강화, HJ 도달가능성 기반 셰일드VLA 제안 Key Point 로봇 AI 모델의 안전성은 실제 배포 시 가장 중요한 과제이며, ShieldVLA는 기존 트레이드오프 방식을 근본적으로 개선하는 새로운 접근법을 제시한다.
핵심 요약
로봇 조작·이동을 수행하는 VLA(Vision-Language-Action) 모델은 일반화 성능이 뛰어나지만 기존 미세조정 방식은 안전성 보장이 부족하다. 현재 방식은 라그랑주 최적화로 누적 비용에 소프트 페널티를 부과하는데, 이는 제약 위반이나 과도하게 보수적 행동을 초래하고 시각 도메인에서 단계별 안전 레이블이 없어 학습이 어렵다. Hamilton-Jacobi(HJ) 도달가능성에 기반한 ShieldVLA를 제안하며, 시각 관찰로부터 HJ 도달가능성 가치함수를 모델-프리 방식으로 근사하여 안전 작동 영역을 추정한다. 전체 요약 6문장 읽기 → 005 22:26 ▲ 11 · 댓글 2 과거 정보 기억하는 로봇 제어 모델 'MemBodied' 제안 비전-언어-행동 모델은 현재 관찰만으로 로봇 제어를 하는데, 과거 정보가 필요한 조작 작업에서 한계를 보인다. AI · 머신러닝 · MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
과거 정보 기억하는 로봇 제어 모델 'MemBodied' 제안 Key Point 과거 관찰 정보가 필요한 로봇 제어 작업에서 컨텍스트 확장의 비효율성을 해결하면서 매개변수 효율성까지 확보한 새로운 메모리 메커니즘이다.
핵심 요약
비전-언어-행동 모델은 현재 관찰만으로 로봇 제어를 하는데, 과거 정보가 필요한 조작 작업에서 한계를 보인다. 과거 관찰을 컨텍스트에 포함하면 해결되지만 컨텍스트 크기 증가와 추론 지연이라는 문제가 발생한다. MemBodied는 고정 크기의 기억 구조로, 상호작용을 기록하는 연관 상태(associative state)와 초기 장면을 보존하는 에피소드 앵커(episode anchor) 두 개 요소로 구성된다. 전체 요약 8문장 읽기 → 006 21:11 ▲ 24 · 댓글 3 로봇 조작 실패 복구하는 AI 정책 프레임워크 공개 로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다. AI · 머신러닝 · CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies
로봇 조작 실패 복구하는 AI 정책 프레임워크 공개 Key Point 로봇 조작 작업의 안정성을 현저히 높이는 새로운 기법으로, 산업용 로봇이나 자동화 시스템의 신뢰도 문제를 실질적으로 개선할 수 있다.
핵심 요약
로봇 팔 조작 중 계획이 틀어지면 성능이 급격히 떨어지는 Vision-Language-Action(VLA) 정책의 문제를 해결하는 CARE 프레임워크를 개발했다. 실제 실패 사례를 수집해 그 패턴을 학습하고, 이를 바탕으로 대표적 실패 상황과 복구 방법을 합성해 훈련시킨다. 추론 시 3D 모니터링으로 실패를 감지하면 작업 진행도를 유지하면서 단계별로 미세 조정하거나 다시 시도한다. 전체 요약 5문장 읽기 →