쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 30일 (수)까지1314건
2건 · "자가학습"조건 지우기 ×
001▲ 10 · 댓글 2동작 중심 영상 학습, 시간축 분리로 효율성 확보영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.AI · 머신러닝 · TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
동작 중심 영상 학습, 시간축 분리로 효율성 확보

Key Point시간과 공간을 분리해 동작 학습을 효율화하는 새로운 방식이 기존 방법보다 훨씬 빠르면서 동시에 여러 벤치마크에서 큰 폭의 성능 향상을 달성했기 때문이다.
핵심 요약
- 영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.
- 이를 해결하기 위해 약 170M~190M 인코더 규모로 24가지 아키텍처-목적함수 조합을 통제된 조건에서 비교했다.
- TT-VidT는 DINOv3으로 초기화한 ViT-B/16 공간 경로와 컴팩트 Temporal Transfer Layer를 조합하고, Diff Compression 목적함수로 첫 프레임 외형 정보와 프레임별 동작 토큰으로부터 타겟 프레임을 재구성하도록 학습한다.
전체 요약 7문장 읽기 → 002▲ 10 · 댓글 1프로그램 검증으로 강화한 시각-언어 모델 자가학습시각-언어 모델의 자가학습은 라벨 없는 이미지에서 생성한 질문으로 학습하는데, 기존 방식은 다수결 투표나 모델 심판으로 답을 결정하면서 24~18% 오류율을 낳고 있다.AI · 머신러닝 · Program-Verified Self-Evolution for Vision-Language Models
프로그램 검증으로 강화한 시각-언어 모델 자가학습

Key Point라벨 없는 데이터로 자가학습하는 모델의 답 검증 정확도를 다수결 투표 76%에서 94%로 끌어올린 방법론이므로, 대규모 비지도 학습 시대에 레이블 수집 비용과 오류 문제를 해결하는 접근법으로 주목할 만하다.
핵심 요약
- 시각-언어 모델의 자가학습은 라벨 없는 이미지에서 생성한 질문으로 학습하는데, 기존 방식은 다수결 투표나 모델 심판으로 답을 결정하면서 24~18% 오류율을 낳고 있다.
- 이를 해결하기 위해 VQS(Verifiable QA Generation for Self-Evolving Models)는 답변 검증 방식을 바꿔서, 이미지를 장면그래프·차트·다이어그램 같은 구조화된 기록으로 파싱한 뒤 고정된 프로그램이 질문과 답을 생성한다.
- 모델은 프로그램이 읽은 개별 사실을 주장 단위로 확인하는 시각 검증자 역할을 하며, 이러한 주장 수준의 검증이 파서의 학습 목표를 선택하므로 파서도 라벨 없이 개선된다.
전체 요약 7문장 읽기 →