Hacker NewsAI · 머신러닝

LLM으로 Jev 수준의 고속 의사결정 모델 구축하기

원제 Turning GLM-5.3-Flash into a Jev-like decision model

102 포인트댓글 42
Key Point

일반 LLM을 구조화된 의사결정 모델로 탈바꿈시키는 프롬프트 기법이 전문 의사결정 모델과 실무 성능에서 동등하다는 것을 보여주므로, 고도량 의사결정 시스템 구축 시 모델 선택지와 비용-성능 트레이드오프 판단에 실질적 참고가 될 수 있다.

핵심 요약

  • GLM-5.3-Flash를 프롬프트 엔지니어링으로 한 번의 forward pass에서 타입화된 의사결정을 내도록 개선했으며, 전문 의사결정 모델 Jev와 동등한 정확도를 달성했다.
  • 기본 아이디어는 LLM의 확률 분포에서 옵션별 확률을 직접 읽는 것이다. 숫자로 인덱싱된 옵션 목록을 JSON으로 제시하고 프롬프트를 'choice_index:'로 끝내면, 모델이 첫 토큰에서 내놓는 확률 분포가 각 옵션의 신뢰도가 된다.
  • 29개 공개 데이터셋(2~151개 옵션, 의도 라우팅·감정 분석·법률 문서 등 포함)을 벤치마킹한 결과, GLM-5.3-Flash와 Jev의 정확도 차이는 중앙값 0.7 포인트로 통계적으로 유의미하지 않았다.
  • Convai의 Laya(4.21억 파라미터)는 대부분 데이터셋에서 13~15 포인트 낮은 정확도를 보였다.
  • 옵션 수가 많을수록 정확도가 떨어지는데, TREC에서 42개 옵션으로 늘리자 Jev는 92.1%에서 85.6%로, GLM-5.3-Flash는 91.2%에서 79.6%로 하락했다.
  • 독일에서 측정 시 GLM-5.3-Flash(Privatemode, EU 호스팅)는 180ms, Jev(미국)는 264ms 응답시간을 보였고, 역지리로 접근하면 순서가 바뀌었다.
  • 비용 측면에서는 Jev가 저렴하다(100만 결정 약 EUR 16 vs GLM-5.3-Flash EUR 62). GLM-5.3-Flash는 옵션당 약 20토큰, Jev는 10토큰을 추가하므로 21개 이상 옵션부터 GLM-5.3-Flash의 토큰 비용이 증가한다.
  • GLM-5.3-Flash는 멀티모달 모델이므로 이미지 입력을 지원하며, 스캔 문서 벤치마크(RVL-CDIP)에서 70.2% 정확도를 달성했다. Jev와 Laya는 텍스트만 처리 가능하다.
  • 151개 옵션(CLINC150) 같은 극단적 경우, vLLM이 최대 128개 확률만 반환하므로 같은 질문을 두 번 요청해 23개 옵션의 확률을 추가로 읽어야 하며, 이 경우 719ms가 소요된다.
  • 추론 모델(chain-of-thought)을 사용하면 정확도가 85.5%에서 89.9%(2개 옵션)로 향상되지만 토큰 수가 수백 개로 증가해 비용이 EUR 350/백만 결정으로 약 5.6배 올라간다.
  • 옵션 이름 바꾸기 테스트에서 GLM-5.3-Flash는 true/false를 correct/wrong으로 변경했을 때 boolq에서 20 포인트 하락한 반면, Jev와 Laya는 3 포인트 미만 변했다.
  • 구현은 vLLM 기반 엔드포인트와 호환되는 Python 라이브러리이며, Privatemode의 기밀 컴퓨팅으로 데이터 암호화를 제공한다. 벤치마크 저장소에서 모든 결과를 재현할 수 있도록 방법론과 원본 데이터를 공개했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗