쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 4일 (일)까지1656건
5건 · "전이 학습"조건 지우기 ×
001▲ 13 · 댓글 2LLM 라우팅을 위한 기초 모델 'RouteFM' 등장대규모언어모델(LLM) 라우팅은 여러 후보 모델 중 각 쿼리에 가장 적합한 모델을 선택해 추론의 품질-효율 트레이드오프를 개선하는 기술이다.AI · 머신러닝 · Pretrain Once, Route Anywhere: Towards a Foundation Model for LLM Routing
LLM 라우팅을 위한 기초 모델 'RouteFM' 등장

Key PointLLM 라우팅이 환경 변화마다 재훈련이 필요한 한계를 극복하고 범용 기초 모델로 통합되면, 실제 배포에서 모델 선택의 유연성과 효율성이 크게 높아질 수 있다.
핵심 요약
- 대규모언어모델(LLM) 라우팅은 여러 후보 모델 중 각 쿼리에 가장 적합한 모델을 선택해 추론의 품질-효율 트레이드오프를 개선하는 기술이다.
- 기존 라우터는 특정 쿼리 워크로드와 후보 모델풀에 최적화되며, 라우팅 환경이 바뀌면 추가 감독이나 재훈련이 필요했다.
- 연구팀은 LLM 라우팅을 기초 모델 관점에서 접근하는 RouteFM을 제시했으며, 모델의 고정된 정체성에 묶이지 않고 익명의 후보 모델을 행동 맥락으로 특성화한다.
전체 요약 7문장 읽기 → 002▲ 121 · 댓글 3LLM 에이전트의 자기 개선 능력 강화하는 AREX-2 발표LLM 에이전트가 테스트 단계에서 해를 반복적으로 개선하는 자기 개선 능력을 갖추도록 하는 AREX-2를 제시한다.AI · 머신러닝 · AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
LLM 에이전트의 자기 개선 능력 강화하는 AREX-2 발표

Key Point기존 LLM 에이전트는 일회성 답변을 생성하는 데 그쳤다면, 반사적 사고를 통해 반복적으로 해결책을 개선할 수 있는 에이전트 설계 방식이 제시되어 자율 문제 해결 능력의 한계를 넘는 가능성을 보여준다.
핵심 요약
- LLM 에이전트가 테스트 단계에서 해를 반복적으로 개선하는 자기 개선 능력을 갖추도록 하는 AREX-2를 제시한다.
- 이 능력은 현재 해보다 나은 해를 만드는 반사적 사고(reflection)와 여러 라운드에서 효과를 유지하는 장기 실행(long-horizon execution) 두 가지를 결합한다.
- 두 능력이 모두 도메인 무관하다고 가정하여, 검증 가능한 피드백을 주는 기계학습과 알고리즘 프로그래밍 작업에서 데이터를 합성해 학습시킨다.
전체 요약 6문장 읽기 → 003▲ 43 · 댓글 1시각 생성 학습이 인식 성능을 높이는 조건이미지 생성(I2I) 작업으로 학습하면 기하학, 공간 관계, 객체 인식 능력 같은 풍부한 지각 능력을 얻을 수 있지만, 시각 이해 능력 향상에 어떻게 도움이 되는지는 명확하지 않았다.AI · 머신러닝 · OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?
시각 생성 학습이 인식 성능을 높이는 조건

Key Point어떤 생성 과제가 어떤 이해 능력을 향상시키는지 체계적으로 규명하면, 멀티모달 모델 학습의 효율성을 크게 높일 수 있기 때문입니다.
핵심 요약
- 이미지 생성(I2I) 작업으로 학습하면 기하학, 공간 관계, 객체 인식 능력 같은 풍부한 지각 능력을 얻을 수 있지만, 시각 이해 능력 향상에 어떻게 도움이 되는지는 명확하지 않았다.
- 연구진은 같은 문제를 다양한 출력 형태로 표현하는 이미지-이미지(I2I) 생성 과제와 이미지-텍스트(I2T) 이해 과제의 짝을 만들어 비교했다.
- 올바른 학습 방식으로 I2I 학습을 진행하면 I2T 성능이 향상되며, I2I 학습 데이터가 많을수록 개선 폭이 크다.
전체 요약 8문장 읽기 → 004▲ 37 · 댓글 3통합 모델이 자기 생성물을 스스로 고치는 방법 찾았다이미지를 보고 만들 수 있는 통합 멀티모달 모델에서, 생성된 이미지의 문제를 진단하고 수정하는 과정을 자동으로 학습하는 방법을 제시했다.AI · 머신러닝 · Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
통합 모델이 자기 생성물을 스스로 고치는 방법 찾았다

Key Point생성형 AI 모델이 자신의 오류를 인식하고 반복적으로 수정하는 능력을 학습하는 방식이 바뀌고 있으며, 이는 이미지 생성의 품질 향상과 모델 구조의 단순화를 동시에 이룬다.
핵심 요약
- 이미지를 보고 만들 수 있는 통합 멀티모달 모델에서, 생성된 이미지의 문제를 진단하고 수정하는 과정을 자동으로 학습하는 방법을 제시했다.
- 기존 지도 학습(SFT)은 시작은 빠르지만 효과적인 수정 경로를 찾지 못했고, 렌더러나 한 부분만 최적화하는 단순한 강화학습(RL)은 잠재력을 충분히 활용하지 못했다.
- UMM-Reflection은 강화학습을 반사 궤적 전체에 적용하되, 같은 초기 이미지를 공유하는 자매 궤적들의 상대적 이점으로 반사 전략을 비교하고, 한 번의 궤적 단위 이점으로 반사 텍스트와 흐름 기반 수정을 함께 업데이트한다.
전체 요약 6문장 읽기 → 005▲ 27 · 댓글 3인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다.AI · 머신러닝 · HuRo: Robotizing Human Videos for Scalable VLA Pretraining
인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인

Key Point저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
- 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다.
- 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다.
- 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다.