추론으로 정확도를 높인 의사결정 모델 Jeeves 공개
원제 Jeeves. Reasoning improves Jev-like decision models
135 포인트댓글 60
Key Point
기존 Jev 계열 모델의 정확도 문제를 추론 과정 포함으로 해결하며, 테스트 데이터에서 실측 3~7% 성능 향상을 달성한 오픈소스 의사결정 모델로, 전체 학습 코드와 가중치를 공개해 재현과 확장이 가능하다.
핵심 요약
- PostHog의 Jeeves는 Qwen3.5-9B 기반의 9B 규모 의사결정 분류기로, 생각하는 과정을 거친 후 답변을 내리도록 학습되었다.
- SFT와 CISPO를 통해 훈련되었으며, 블록-4 디퓨전 드래프터를 포함한다.
- 미학습된 테스트 데이터에서 Kev-9B(0.822), Jev(0.857)를 상회하는 0.889의 정확도를 달성했으며, JevBench 공개 계층에서는 0.935(Jev 0.866 대비)를 기록했다.
- 네/아니오, 객관식, 평점 질문을 하나의 요청에서 동시에 처리할 수 있는 Jev 호환 API를 제공한다.
- 생각 없이 약 0.3초, 중앙값 3.3초(H100 한 개)가 소요되며, chain 길이를 줄여 속도를 높일 수 있다.
- 기존 Jev 계열 모델들은 보정된 확률을 주지만 정확도가 낮아 추론 모델을 보조로 쓰는 문제가 있었는데, Jeeves는 답변 전에 추론을 포함해 도메인 외 작업에서 성능을 향상시킨다.
- 숨겨진 상태 문제와 대조 정책에서는 완벽한 1.0 정확도를 기록했으나, MMLU(0.793 vs 0.900), MMLU-Pro(0.739 vs 0.840)처럼 지식 기반 문제에서는 Jev에 뒤진다.
- 추론 chain은 최대 2,560 토큰으로 제한되며, max_think와 nothink_threshold 옵션으로 지연 시간과 정확도를 조정할 수 있다.
- 19,126개 질문으로 SFT 학습(2 에포크, 8 GPU에서 596 스텝)과 9,992개 RL 질문으로 CISPO 학습(624 스텝 중 402 스텝)을 거쳤다.
- LoRA r=16 적응과 포인터 헤드를 Qwen3.5-9B의 모든 프로젝션에 적용했으며, 온도 스케일링으로 보정을 맞췄다.
- 디퓨전 드래프터는 기존 Orthrus와 달리 Gated DeltaNet 레이어를 지원하며, 블록-4 사용 시 순차 decoding 대비 1.6배 빠른 처리 속도를 낸다.
- 전체 학습 코드, 훈련/검증/테스트 데이터, CUDA(Hopper) 지원 서버를 공개했으며, Python SDK는 Jev SDK의 drop-in 대체로 사용 가능하다.
- 한계점으로 사상 지연이 17초에 달하고(p90), 추론 chain이 해석 불가능하도록 설계되었다는 점이 있다.