의사결정만 하는 판정 AI, 비용 1% 수준으로 정확성 99% 달성
원제 JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
추천 17댓글 1
Key Point
LLM 평가 비용 문제를 해결하려는 개발자와 스타트업에게 저비용 우선심사 모델의 실제 성능 한계를 보여주는 실증 데이터입니다.
핵심 요약
- LLM 판정자는 다양한 작업 평가가 가능하지만 추론 비용이 크다는 문제가 있습니다.
- 의사결정만 수행하는 JEV 판정자를 기존의 생성형·보상모델 판정자들과 비교한 결과, 생성형 LLM 판정자 대비 0.36% 수준의 비용으로 일반적 선호도와 증거 기반 팩트체크에서 3%포인트 이내의 정확성을 유지했습니다.
- 도출 검증이나 정교한 오류 답변 거절이 필요한 판정에서는 더 큰 격차가 발생합니다.
- 신뢰도가 높은 판정은 승인하고 불확실한 판정만 상위 시스템으로 넘기는 계층 구조로 운영하면 비용 절감 속에서도 99% 정확성을 유지할 수 있습니다.