Reflection, 501B 파라미터 오픈소스 모델 'Beam' 공개
원제 Beam: Reflection's 501B open-weight model
160 포인트댓글 46

Key Point
고효율 오픈소스 에이전트 모델이 공개되며, 특히 추론 효율에서 훨씬 큰 모델과 경쟁할 수 있다는 점이 엔터프라이즈 코딩 워크로드에 미치는 영향이 크다.
핵심 요약
- Reflection이 오픈가중치 희소 혼합전문가(MoE) 모델인 Beam을 발표했다. 총 501억 개 파라미터 중 23억 개만 활성화되며, 코딩·추론·에이전트 작업에 최적화됐다.
- Beam은 웹과 라이선스 데이터셋의 23.8조 개 토큰으로 사전학습되었으며, 10.5K NVIDIA GB300 GPU에서 4주간 RL을 실행해 1억 개 이상의 롤아웃을 생성했다.
- 코딩·에이전트 작업에서 GLM 5.2와 경쟁력 있는 성능을 보이며, Qwen 3.8-Max에 근접한다. 특히 추론 효율에서 우위가 있어 GLM 5.2 대비 3~4배 적은 계산량으로 유사한 추론 능력을 제공한다.
- 고계산RL 훈련에서 비동기 정책 기울기를 사용하며, 정책 노후화 문제를 해결하기 위해 수치적 안정성을 유지하는 새로운 알고리즘을 개발했다. 1일 노후화(107개 가중치 버전 뒤처짐) 상태에서도 안정적 학습이 가능했다.
- 학습 중 완료 길이 페널티로 효율성을 추구하는 추론을 유도했다. RL 초기에 성능 향상과 함께 완료 길이가 단축되다가 나중에 다시 증가해 성능을 개선했으며, 사용자는 '추론 노력' 파라미터로 응답 길이와 성능의 트레이드오프를 제어할 수 있다.
- 추론·소프트웨어공학·터미널 작업 RL 중에 명시적으로 웹 검색 작업을 학습하지 않았는데도 웹 브라우징 성능이 향상되어, 일반화된 에이전트 능력을 학습했음을 보여줬다.
- 사전학습 단계에서 23.8조 토큰을 웹·소스코드·기술문서에서 수집했으며, 기존 웹 필터보다 1.8조 개의 고품질 토큰을 추가로 유지했다. PDF 처리 파이프라인으로 STEM 콘텐츠도 처리했다.
- 혼합전문가 최적화에서 보조손실 없는 로드밸런싱과 코사인 감쇠를 적용해 거의 완벽한 균등 활용(최대 1.04배)을 달성했으며, 깊이 기반 스케일링으로 잔차 흐름 안정성을 유지했다.
- 사전학습을 4주 내에 6,144개 NVIDIA GB300 GPU에서 완료했으며, 토폴로지 인식 스케줄러·노드 생명주기 시스템·SDC 감지 시스템으로 92.3%의 굿풋을 달성했다.
- 미드트레이닝 단계에서 멀티스테이지 데이터 큐레이션 파이프라인과 장문 추론 문서로 RL을 위한 토대를 마련했고, 1M 토큰까지 문맥 길이를 확장했다.
- 안정성과 정렬을 위해 별도 SFT와 RL 파이프라인으로 훈련한 모델을 다중교사 정책 내 증류(MOPD)로 병합했으며, 3계층 원칙(규칙 준수·일관된 특성·상호작용 스타일)으로 조직했다.
- 모델 가중치·기술 보고서·모델 카드·개발자 도구는 이달 말 공개될 예정이며, 현재 얼리 액세스 가입을 받고 있다.