Jeff: 0.8B 경량 분류 모델로 30ms 만에 선택지 판단
원제 Jeff – Jev-compatible 0.8B decision models, trained at home, ~30 ms
205 포인트댓글 66
Key Point
경량 모델로 30ms 안에 로컬에서 고속 분류를 수행할 수 있어, API 지연 없이 의사결정 시스템을 직접 구축해야 하는 개발자에게 즉시 활용 가능한 솔루션이다.
핵심 요약
- Qwen3.5와 Gemma 4를 파인튜닝한 0.8B~2B 경량 분류 모델 Jeff를 공개했다.
- 한 번의 순전파로 각 선택지의 보정된 확률을 반환하며, RTX PRO 6000에서 22ms, Apple M4 Max에서 28ms가 소요된다.
- 제로샷 분류가 가능해 학습 데이터에 없는 옵션도 자연어 설명으로 판단할 수 있다.
- 고객 지원, 사용자 의도, 중재, 음성 명령 등 다양한 용도에 활용 가능하다.
- 벤치마크 5개 데이터셋에서 전체 79.1%(0.8B)~83.1%(2B) 정확도로 기존 Jev 모델에 근접하거나 상회한다.
- 게임 테스트에서 Doom과 Frogger는 손코딩 규칙 봇 수준의 성능을 보였고, Pac-Man에서는 57점을 기록했다.
- 음성 네비게이션 파인튜닝은 31.7%에서 95.8%로 정확도를 올렸으며, 단일 GPU에서 30분 이내에 완료되었다.
- 0.8B 모델은 RTX PRO 6000에서 약 2시간, 2B는 3.5시간에 학습되며 모든 훈련이 로컬 하드웨어에서 이루어진다.
- 합성 훈련 데이터는 Qwen3.8-Flash-Next로 생성했고, 폐쇄형 모델은 데이터 품질 검증에만 사용했다.
- Jev와 동일한 요청 형식을 지원하지만 TypeSafe와는 무관한 독립 프로젝트다.
- 모델은 Hugging Face에서 다운로드 가능하며, 코드는 MIT, 가중치는 Apache 2.0 라이선스로 공개된다.
- 분류 작업에 최적화되어 다단계 추론은 작동하지 않으며, 선택지 설명의 문구가 성능에 큰 영향을 미친다.
- CPU에서는 463~1008ms가 필요하고, 0.8B가 2B보다 게임 성능이 우수하나 학습 후 2B가 더 보수적으로 변한다.
- 옵션 설명의 일관성과 길이, 질문의 독립성이 성능 향상의 핵심이다.