Hugging Face 논문AI · 머신러닝오늘의 주요

인코더 레이어 융합 최적화로 이미지 생성-재구성 성능 차이 해소

원제 FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

추천 21댓글 1Hongyang Du, Yunfei Xie, Junjie Ye 외
Key Point

RAE 기반 이미지 생성 시스템에서 인코더 레이어 선택에 따른 성능 트레이드오프를 정규화 기법으로 해결하는 방법을 제시해, 생성 품질과 재구성 품질을 동시에 개선할 수 있음을 보여준다.

핵심 요약

  • Representation Autoencoder(RAE)는 사전학습된 비전 인코더의 피처를 재구성과 확산 잠재공간으로 재사용해 이미지 생성에 강력한 표현을 통합한다.
  • 기존 RAE는 어느 인코더 레이어가 생성기와 픽셀 디코더의 공유 잠재공간을 형성할지 결정해야 하는데, 얕은 레이어는 세부 픽셀 정보를 잘 보존하지만 깊은 레이어는 생성 품질이 우수한 트레이드오프가 존재한다.
  • FuseReg는 휴리스틱 피처 선택을 인코더 레이어의 무작위 부분집합 학습으로 대체하여 레이어 간 불일치의 민감도를 명시적으로 페널라이즈한다.
  • ImageNet-256에서 DINOv3-L을 사용한 결과, FuseReg 디코더 하나가 전체·희소·단일 레이어 융합에서 재훈련 없이 고정 융합 전문 디코더보다 높은 PSNR을 달성한다.
  • 디코더만 교체해도 RAEv2 DiT-XL 생성기의 무지도 gFID가 27% 감소했으며, 두 단계 모두에 정규화를 적용하면 DiT-Base에서 무지도 gFID가 29% 감소한다.
  • 사전학습된 인코더를 수정하지 않고 다운스트림 모델을 레이어 융합 견고성으로 학습하면 재구성-생성 간의 성능 격차를 해소할 수 있다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗