VisionHOPE: 자기 적응 학습 비전 백본
원제 VisionHOPE: Visual Backbones as Self-Modifying Learning Systems
추천 106댓글 1
Key Point
CNN에서 Vision Transformer를 거쳐 Test-Time Training까지 진화해온 비전 백본을 자기 적응 학습 시스템으로 재구성하는 새로운 접근이 어떻게 안정성을 확보하고 실제 성능을 올렸는지 보여주는 논문이다.
핵심 요약
- VisionHOPE는 이미지 처리 중 모델의 메모리와 학습 규칙이 함께 진화하는 자기수정 학습 시스템 형태의 비전 백본이다.
- Nested Learning의 자기참조 구조를 기반으로, 내용 저장, 키·값 표현 생성, 학습률 및 메모리 보유를 관장하는 5개의 연결된 메모리를 통해 진화를 구현한다.
- 직접 적용 시 불안정성이 발생하므로, 자기참조 주입에 소프트 캡을 씌우고 메모리 전환에 스펙트럼 클램프를 적용하는 단계 크기 제어 방식을 개발했으며, 이 메모리 동역학이 비확대(non-expansive)임을 증명했다.
- 2D 특성맵을 위해 Nested Learning의 청크 공식을 조정하여 청크를 이미지의 행과 열에 정렬하고 4개 방향 스캔을 수행한다.
- ImageNet-1K, COCO, ADE20K에서 경쟁력 있는 성능을 달성하여 자기수정 학습 시스템이 범용 비전 백본의 실용적 기초임을 입증했다.
- 코드는 GitHub에서 공개되어 있다.