픽셀 디퓨전 모델에 적대적 학습 추가로 고주파 품질 개선
Key Point
픽셀 디퓨전이 기존 오토인코더 기반 모델의 문제를 우회한다는 점에서 더 직접적인 방식이었으나, 미세한 디테일 손실 문제를 적대적 학습으로 해결할 수 있음을 보여주는 실질적 개선 방법이기 때문입니다.
핵심 요약
- 픽셀 디퓨전 모델은 오토인코더 병목을 피해 RGB 이미지를 직접 생성하지만, 미세한 자연 이미지 통계를 체계적으로 과소 표현하는 문제가 있다.
- 연구팀은 사전학습된 모델에 적대적 손실을 더해 이 결함을 보정하는 방법을 제시했다. 원래 확산 또는 플로우 매칭 목표를 유지하면서 비고노이즈 타임스텝에서만 적대적 손실을 예측 출력에 추가한다.
- 모델 아키텍처와 샘플링 절차는 변경하지 않으며, 픽셀 디퓨전의 적대적 사후학습에 대한 첫 체계적 연구다.