001▲ 11 · 댓글 1루브릭 기반 강화학습의 보상 문제 해결하는 MetaRubric루브릭 기반 강화학습은 개별 응답 요구사항에 부분 점수를 할당해 개방형 과제를 최적화하지만, 루브릭 판정자가 필수 정보나 행동이 없어도 높은 점수를 주는 '공허한 신용(Vacuous Credit)' 문제가 발생한다.
AI · 머신러닝 · MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
004▲ 17 · 댓글 3오픈소스로 공개된 GLM 초거대 모델 학습법Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다.
AI · 머신러닝 · Rufus-Air: An Open LLM Post-Training Recipe
106B급 거대 언어모델의 전체 학습 파이프라인을 완벽히 공개한 첫 사례로, 독립적인 모델 개발을 시도하는 연구팀과 기업들이 직접 참고할 수 있는 실증적 설계서다.
핵심 요약
Rufus-Air는 GLM-4.5-Air-Base(106B-A12B) 모델의 오픈 소스 포스트트레이닝 레시피로, SFT·Reasoning RL·Coding RL·Instruction-Following RL·General Agent·Coding Agent·Search Agent·RLHF 8단계 파이프라인으로 구성된다.
데이터·보상 설계·인프라·단계 순서·단계별 결과를 공개하여 누구나 재현할 수 있도록 했으며, 새로운 인간 주석이나 자체 증류 교사 없이 공개 데이터와 오픈소스 컴포넌트를 그대로 사용했다.
기초 능력부터 고급 능력으로 진행되며, 검증 가능한 보상에서 판사 기반 신호로 점진적으로 전환된다.