Hugging Face 논문AI · 머신러닝

동작 중심 영상 학습, 시간축 분리로 효율성 확보

원제 TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining

추천 10댓글 2Shih-Ying Yeh, Daniel Z. Kaplan, Xuehai Wang 외
Key Point

시간과 공간을 분리해 동작 학습을 효율화하는 새로운 방식이 기존 방법보다 훨씬 빠르면서 동시에 여러 벤치마크에서 큰 폭의 성능 향상을 달성했기 때문이다.

핵심 요약

  • 영상 자가학습에서 아키텍처와 목적함수, 데이터, 학습 일정 등 여러 요소가 동시에 변해 동작 우선 표현 학습의 효과를 명확히 파악하기 어려운 점을 지적한다.
  • 이를 해결하기 위해 약 170M~190M 인코더 규모로 24가지 아키텍처-목적함수 조합을 통제된 조건에서 비교했다.
  • TT-VidT는 DINOv3으로 초기화한 ViT-B/16 공간 경로와 컴팩트 Temporal Transfer Layer를 조합하고, Diff Compression 목적함수로 첫 프레임 외형 정보와 프레임별 동작 토큰으로부터 타겟 프레임을 재구성하도록 학습한다.
  • 결과적으로 TT3D와 Diff Compression 조합만이 가장 강한 동작 감지 성능을 달성했으며, 컴팩트 디코더가 더 효과적임을 확인했다.
  • Jester, Something-Something V2, ARID, Diving48 미세조정에서 기존 최고 성능 대비 54~121% 향상을 이뤘다.
  • 인코더 연산량은 DisMo 대비 48%, VideoMAE·V-JEPA2 대비 55% 감소했다.
  • HMDB51, IARD, EPIC-Kitchens 데이터셋에서도 성능을 검증했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗