시각 생성 학습이 인식 성능을 높이는 조건
원제 OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?
추천 43댓글 1
Key Point
어떤 생성 과제가 어떤 이해 능력을 향상시키는지 체계적으로 규명하면, 멀티모달 모델 학습의 효율성을 크게 높일 수 있기 때문입니다.
핵심 요약
- 이미지 생성(I2I) 작업으로 학습하면 기하학, 공간 관계, 객체 인식 능력 같은 풍부한 지각 능력을 얻을 수 있지만, 시각 이해 능력 향상에 어떻게 도움이 되는지는 명확하지 않았다.
- 연구진은 같은 문제를 다양한 출력 형태로 표현하는 이미지-이미지(I2I) 생성 과제와 이미지-텍스트(I2T) 이해 과제의 짝을 만들어 비교했다.
- 올바른 학습 방식으로 I2I 학습을 진행하면 I2T 성능이 향상되며, I2I 학습 데이터가 많을수록 개선 폭이 크다.
- 19개 I2I 생성 과제와 25개 I2T 이해 능력을 아우르는 OmniTaskonomy 분류 체계를 제시해 과제 간 전이 효과를 체계적으로 매핑했다.
- 깊이 예측이 3D 추론을 향상시키고, 객체 지시가 개수 세기를 개선하며, 직소 퍼즐 재구성이 2D 순서 파악을 돕는 등 직관적인 대응 관계들을 발견했다.
- 2.5D 분할이 카테고리 인식을 향상시키고 Z-깊이 예측이 위치 파악을 개선하는 등 예상 밖의 긍정적 연결도 확인했다.
- 생성 과제와 이해 과제 간 그래디언트 정렬을 분석한 결과, 정렬이 강할수록 전이 학습 이득이 크다는 패턴을 발견했다.
- 결과적으로 시각 생성이 시각 이해를 위한 풍부한 지도 신호 원천임을 보여주며, 올바른 학습 순서와 과제 선택으로 이점을 활용할 수 있는 로드맵을 제공한다.