이미지 유무가 판단을 휘흔든다, VLM 평가의 숨은 함정
Key Point
VLM을 평가자로 대체할 때 지침 준수 여부가 아니라 평가 환경 자체가 판단을 흔드는 것으로 나타나, 모델 능력 평가의 신뢰성을 다시 생각해야 한다.
핵심 요약
- VLM(시각-언어 모델)이 인간 평가자 대신 사용되면서, 평가 환경 자체가 모델 성능에 미치는 영향을 검증해야 한다는 문제 제기.
- 연구팀이 MIST(Misleading-Image Stress Test)라는 테스트 세트를 개발했다: 비유와 문자적 의미로 해석 가능한 영문 문장 200개씩, 각 문장마다 일치 이미지, 반대 이미지, 이미지 없음 세 가지 조건으로 평가했다.
- 지침상 이미지는 무시하고 문장만으로 판단해야 했다.