Hugging Face 논문AI · 머신러닝

이미지 유무가 판단을 휘흔든다, VLM 평가의 숨은 함정

원제 It's Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them

추천 36댓글 2Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem 외
Key Point

VLM을 평가자로 대체할 때 지침 준수 여부가 아니라 평가 환경 자체가 판단을 흔드는 것으로 나타나, 모델 능력 평가의 신뢰성을 다시 생각해야 한다.

핵심 요약

  • VLM(시각-언어 모델)이 인간 평가자 대신 사용되면서, 평가 환경 자체가 모델 성능에 미치는 영향을 검증해야 한다는 문제 제기.
  • 연구팀이 MIST(Misleading-Image Stress Test)라는 테스트 세트를 개발했다: 비유와 문자적 의미로 해석 가능한 영문 문장 200개씩, 각 문장마다 일치 이미지, 반대 이미지, 이미지 없음 세 가지 조건으로 평가했다.
  • 지침상 이미지는 무시하고 문장만으로 판단해야 했다.
  • 13개 VLM 모델 전체에서 일치 이미지는 20.5%, 반대 이미지는 19.4% 비율로 답변을 바꿨으며, 이는 이미지를 무시하라는 지시를 없앤 경우(11.6%)보다 훨씬 컸다.
  • 흥미롭게도, 두 이미지 조건 간에 차이 난 답변 중 오직 37%만 보여진 이미지의 의미 방향으로 이동했다.
  • 인간 평가자와의 일치도는 이미지 유무나 종류(일치/반대)와 관계없이 동일했다.
  • Alt 테스트를 통과한 7개 모델이 통과하지 못한 6개보다 효과가 작긴 했지만, 모든 모델에서 이 현상이 나타났다.
  • 결론: VLM의 답변 변화는 특정 이미지 콘텐츠 때문이 아니라 단순히 이미지 존재 여부 때문이며, VLM 평가의 신뢰성은 모델뿐 아니라 평가 설정 환경의 영향도 받는다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗