프로그램 검증으로 강화한 시각-언어 모델 자가학습
Key Point
라벨 없는 데이터로 자가학습하는 모델의 답 검증 정확도를 다수결 투표 76%에서 94%로 끌어올린 방법론이므로, 대규모 비지도 학습 시대에 레이블 수집 비용과 오류 문제를 해결하는 접근법으로 주목할 만하다.
핵심 요약
- 시각-언어 모델의 자가학습은 라벨 없는 이미지에서 생성한 질문으로 학습하는데, 기존 방식은 다수결 투표나 모델 심판으로 답을 결정하면서 24~18% 오류율을 낳고 있다.
- 이를 해결하기 위해 VQS(Verifiable QA Generation for Self-Evolving Models)는 답변 검증 방식을 바꿔서, 이미지를 장면그래프·차트·다이어그램 같은 구조화된 기록으로 파싱한 뒤 고정된 프로그램이 질문과 답을 생성한다.
- 모델은 프로그램이 읽은 개별 사실을 주장 단위로 확인하는 시각 검증자 역할을 하며, 이러한 주장 수준의 검증이 파서의 학습 목표를 선택하므로 파서도 라벨 없이 개선된다.