Hugging Face 논문AI · 머신러닝오늘의 주요

오픈소스로 공개된 GLM 초거대 모델 학습법

원제 Rufus-Air: An Open LLM Post-Training Recipe

추천 12댓글 2Chia-Yuan Chang, Renyuan Cheng, Rui Feng 외
Key Point

106B급 거대 언어모델의 전체 학습 파이프라인을 완벽히 공개한 첫 사례로, 독립적인 모델 개발을 시도하는 연구팀과 기업들이 직접 참고할 수 있는 실증적 설계서다.

핵심 요약

  • Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다.
  • 데이터·보상 설계·인프라·단계 순서·단계별 결과를 공개하여 누구나 재현할 수 있도록 했으며, 새로운 인간 주석이나 자체 증류 교사 없이 공개 데이터와 오픈소스 컴포넌트를 그대로 사용했다.
  • 기초 능력부터 고급 능력으로 진행되며, 검증 가능한 보상에서 판사 기반 신호로 점진적으로 전환된다.
  • 주요 발견은 다음과 같다: (1) 다양하고 고품질 SFT가 강한 기초 능력을 구축한다, (2) 난이도 필터링이 RL 프롬프트를 최적 학습 범위 내에 유지한다, (3) 보상 신뢰도가 단계 순서 결정의 실질적 원칙이 된다, (4) 인프라와 엔지니어링 선택이 레시피의 중요 요소다.
  • Rufus-Air는 공식 GLM-4.5-Air 포스트트레이닝 릴리스를 개선했으며 같은 크기 오픈 모델들과 경쟁력 있는 성능을 보인다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗