쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1537건
3건 · "MAE"조건 지우기 ×
001▲ 12 · 댓글 1동영상 스트림으로 자기지도학습하는 StreamMAE 제시자기지도학습은 영아 시각 발달을 모방하지만 현재 학습은 이미지를 무작위로 섞어 쓰는데, 이 논문은 연속 동영상 스트림으로부터의 학습을 연구했다.AI · 머신러닝 · I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
동영상 스트림으로 자기지도학습하는 StreamMAE 제시

Key Point영아가 학습하는 방식과 유사한 연속 동영상 스트림에서 자기지도학습이 왜 어려운지, 그리고 이를 극복하는 기술적 방법을 제시하는 논문으로, 현실 세계의 실시간 영상 데이터 활용에 영향을 미칠 수 있다.
핵심 요약
- 자기지도학습은 영아 시각 발달을 모방하지만 현재 학습은 이미지를 무작위로 섞어 쓰는데, 이 논문은 연속 동영상 스트림으로부터의 학습을 연구했다.
- 95시간 도시 산책 동영상으로 만든 WT++ 데이터셋에서 시간 순서대로 슬라이딩 윈도우 배치로 프레임을 처리하되, 전역 셔플이나 멀티에포크 재생 없이 학습했다.
- 대조 학습과 증류 기반 방법은 이 설정에서 성능이 떨어졌고, MAE도 기준 i.i.d. 사전학습에 못 미쳤다.
전체 요약 6문장 읽기 → 002▲ 13 · 댓글 3동작 중심 영상 학습, 시간축 분리로 효율성 확보영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.AI · 머신러닝 · TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
동작 중심 영상 학습, 시간축 분리로 효율성 확보

Key Point시간과 공간을 분리해 동작 학습을 효율화하는 새로운 방식이 기존 방법보다 훨씬 빠르면서 동시에 여러 벤치마크에서 큰 폭의 성능 향상을 달성했기 때문이다.
핵심 요약
- 영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.
- 이를 해결하기 위해 약 170M~190M 인코더 규모로 24가지 아키텍처-목적함수 조합을 통제된 조건에서 비교했다.
- TT-VidT는 DINOv3으로 초기화한 ViT-B/16 공간 경로와 컴팩트 Temporal Transfer Layer를 조합하고, Diff Compression 목적함수로 첫 프레임 외형 정보와 프레임별 동작 토큰으로부터 타겟 프레임을 재구성하도록 학습한다.
전체 요약 7문장 읽기 → 003▲ 46 · 댓글 2텍스트·이미지·영상·음성을 하나로 이해하는 멀티모달 임베딩 모델 공개Hugging Face 연구팀이 텍스트, 이미지, 영상, 음성을 통합으로 처리하는 Ovis-Embedding을 발표했다.AI · 머신러닝 · Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
텍스트·이미지·영상·음성을 하나로 이해하는 멀티모달 임베딩 모델 공개

Key Point단일 모달리티 검색의 한계를 극복하고 텍스트-영상, 음성-텍스트 등 크로스 모달 검색이 필요한 개발자와 연구자에게 새로운 기술 선택지를 제공한다.
핵심 요약
- Hugging Face 연구팀이 텍스트, 이미지, 영상, 음성을 통합으로 처리하는 Ovis-Embedding을 발표했다.
- 기존의 분리된 모달리티 타워 대신 공유 멀티모달 백본을 사용해 모든 데이터를 공통 표현 공간으로 인코딩한다.
- Qwen-omni 사전학습 모델을 기반으로 대조 학습과 저랭크 초기화를 통해 학습했다.
전체 요약 5문장 읽기 →