이미지 유무가 판단을 휘흔든다, VLM 평가의 숨은 함정
원제 It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them
추천 36댓글 2
Key Point
VLM을 평가자로 대체할 때 지침 준수 여부가 아니라 평가 환경 자체가 판단을 흔드는 것으로 나타나, 모델 능력 평가의 신뢰성을 다시 생각해야 한다.
핵심 요약
- VLM(시각-언어 모델)이 인간 평가자 대신 사용되면서, 평가 환경 자체가 모델 성능에 미치는 영향을 검증해야 한다는 문제 제기.
- 연구팀이 MIST(Misleading-Image Stress Test)라는 테스트 세트를 개발했다: 비유와 문자적 의미로 해석 가능한 영문 문장 200개씩, 각 문장마다 일치 이미지, 반대 이미지, 이미지 없음 세 가지 조건으로 평가했다.
- 지침상 이미지는 무시하고 문장만으로 판단해야 했다.
- 13개 VLM 모델 전체에서 일치 이미지는 20.5%, 반대 이미지는 19.4% 비율로 답변을 바꿨으며, 이는 이미지를 무시하라는 지시를 없앤 경우(11.6%)보다 훨씬 컸다.
- 흥미롭게도, 두 이미지 조건 간에 차이 난 답변 중 오직 37%만 보여진 이미지의 의미 방향으로 이동했다.
- 인간 평가자와의 일치도는 이미지 유무나 종류(일치/반대)와 관계없이 동일했다.
- Alt 테스트를 통과한 7개 모델이 통과하지 못한 6개보다 효과가 작긴 했지만, 모든 모델에서 이 현상이 나타났다.
- 결론: VLM의 답변 변화는 특정 이미지 콘텐츠 때문이 아니라 단순히 이미지 존재 여부 때문이며, VLM 평가의 신뢰성은 모델뿐 아니라 평가 설정 환경의 영향도 받는다.