동영상 스트림으로 자기지도학습하는 StreamMAE 제시
원제 I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
추천 12댓글 1
Key Point
영아가 학습하는 방식과 유사한 연속 동영상 스트림에서 자기지도학습이 왜 어려운지, 그리고 이를 극복하는 기술적 방법을 제시하는 논문으로, 현실 세계의 실시간 영상 데이터 활용에 영향을 미칠 수 있다.
핵심 요약
- 자기지도학습은 영아 시각 발달을 모방하지만 현재 학습은 이미지를 무작위로 섞어 쓰는데, 이 논문은 연속 동영상 스트림으로부터의 학습을 연구했다.
- 95시간 도시 산책 동영상으로 만든 WT++ 데이터셋에서 시간 순서대로 슬라이딩 윈도우 배치로 프레임을 처리하되, 전역 셔플이나 멀티에포크 재생 없이 학습했다.
- 대조 학습과 증류 기반 방법은 이 설정에서 성능이 떨어졌고, MAE도 기준 i.i.d. 사전학습에 못 미쳤다.
- 배치 간 고유사성은 문제가 아니었지만, 배치 내 고유사성(연속 프레임이 거의 중복)이 주 원인으로 확인됐다.
- 이를 해결하기 위해 StreamMAE를 제시했으며, MAE 재구성 목표는 유지하면서 스트림 인식 정규화와 움직임 기반 크롭 선택으로 입력 파이프라인을 개선했다.
- StreamMAE는 스트리밍 기준선을 앞지르고, 같은 동영상으로 학습한 i.i.d. MAE와 성능이 같으며, ImageNet 사전학습 MAE와 경쟁력 있고, 12시간에서 95시간으로 스트림이 커질수록 성능이 향상됐다.