001▲ 12 · 댓글 2오픈소스로 공개된 GLM 초거대 모델 학습법Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다.
AI · 머신러닝 · Rufus-Air: An Open LLM Post-Training Recipe
오픈소스로 공개된 GLM 초거대 모델 학습법
Key Point
106B급 거대 언어모델의 전체 학습 파이프라인을 완벽히 공개한 첫 사례로, 독립적인 모델 개발을 시도하는 연구팀과 기업들이 직접 참고할 수 있는 실증적 설계서다.
핵심 요약
Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다.
데이터·보상 설계·인프라·단계 순서·단계별 결과를 공개하여 누구나 재현할 수 있도록 했으며, 새로운 인간 주석이나 자체 증류 교사 없이 공개 데이터와 오픈소스 컴포넌트를 그대로 사용했다.
기초 능력부터 고급 능력으로 진행되며, 검증 가능한 보상에서 판사 기반 신호로 점진적으로 전환된다.