의미·기하 구조 동시 학습, 픽셀 확산 모델 성능 끌어올리다
원제 PixelDense: Dense Prediction as Representation Alignment for Pixel Diffusion
추천 13댓글 2
Key Point
의미 정보와 기하 정보를 분리해 학습하는 구조적 혁신으로 텍스트-이미지 생성부터 이미지 편집까지 여러 작업에서 동시에 성능을 끌어올렸으며, 전통적 단일 정렬 방식의 한계를 넘었다.
핵심 요약
- Representation alignment(REPA)는 확산 트랜스포머 학습을 가속화하는 기법인데, 기존엔 의미 정보(DINOv2, CLIP)만을 정렬 대상으로 삼았다.
- 최근 분석이 정렬 효과의 핵심이 의미 정보가 아닌 공간 구조(spatial structure)임을 지적했으나, 그러한 구조를 예측하도록 훈련된 기초 모델들은 간과되어 왔다.
- 픽셀 공간 확산에서 SAM2, Depth Anything v2, Metric3D v2는 DINOv2 단독 기준보다 우수하며, 특히 기하 정보를 학습하는 모델들이 분할 모델을 앞선다.
- 단순히 네 모델의 그래디언트를 합산하면 의미·기하 정보가 하나의 디노이저 프로젝션을 놓고 경쟁하면서 최고 단일 모델보다 성능이 떨어진다.
- PixelDense는 DINOv2와 SAM2를 의미 정보 스트림으로, Depth Anything v2와 Metric3D v2를 기하 정보 스트림으로 분리 라우팅하고, 두 스트림이 직교 부분공간에 머물도록 가중치 공간 정규화를 추가한다.
- 네 모델 모두 훈련 중 동결되고 추론 시 제거된다.
- PixelGen과 DeCo에 적용한 결과 GenEval, DPG-Bench, HPS v2.1을 개선했으며, PixelGen-XXL의 GenEval을 0.7927에서 0.8093으로 끌어올렸다.
- 부분 노이즈 재구성에서 COCO와 Flickr30K 데이터셋에서 τ=0.5일 때 팬옵틱 분할은 최대 53.1% PQ 향상, 깊이 맵 오차는 36.0% AbsRel 감소를 달성했다.
- 무작위 초기화부터 시작해 기저 모델의 최고 성능에 도달하기까지 1.23배 빠르다.
- SDEdit를 이용한 이미지 편집 평가(PIE-Bench)에서 모든 편집 강도 수준에서 배경을 더 잘 보존하고 배경 PSNR을 최대 2.2 dB 향상시킨다.