LLM의 진정한 실력은 정확도가 아니라 안정성에서
원제 Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
추천 11댓글 2
Key Point
LLM의 정말 믿을 수 있는 성능을 판단하려면 단순 정확도가 아니라 얼마나 일관되게 답하는지를 평가해야 하며, 이 새로운 평가 방식이 기존 벤치마크 순위를 뒤바꿀 수 있다는 점이 중요하다.
핵심 요약
- LLM의 생성 안정성, 즉 같은 입력을 다르게 표현했을 때 일관되고 의미있는 출력을 내보내는 능력을 새로운 관점에서 평가해야 한다는 주장이다.
- 기존 평가는 단일 프롬프트 형식이나 한정된 변형 집합에서 집계 정확도를 측정하는 방식으로, 견고성과 벤치마크 성능을 혼동하고 있다고 지적한다.
- 연구팀은 개별 예시 수준에서, 여러 입력 변형 구간에서, 모델 행동의 다양한 측면을 측정하는 새로운 평가 프레임워크를 제안한다.
- 생성 일관성, 내부 활성화, 신뢰도, 응답 반사 등 여러 차원의 변동성을 포착하는 '안정성 인식 생성 목표(SAGO)' 메트릭을 도입했다.
- 이 메트릭으로 평가하면 많은 널리 쓰이는 모델들이 통계적으로 유의미한 생성 불안정성을 보인다.
- 모델마다 불안정성의 패턴이 다르며, 행동 축별로 독립적인 실패 사례가 포착되고, 데이터셋 간 변동이 모델 순위를 역전시킬 수 있다는 점을 발견했다.