Hugging Face 논문AI · 머신러닝

LLM 학습 중 병렬화 동적 최적화하는 Nereus 공개

원제 Nereus: Adaptive Parallelism for LLM Post-Training

추천 10댓글 3Songlin Jiang, Tuo Shi, Sitong Zhang 외
Key Point

LLM 후학습에서 GPU 자원과 메모리 상황이 실시간으로 변할 때 자동으로 병렬화 전략을 재조정하므로, 대규모 모델 훈련 비용을 크게 절감하려는 조직이 검토할 필요가 있다.

핵심 요약

  • LLM의 강화학습 후학습 단계에서 여러 모델을 GPU 클러스터에 배치할 때 자원 가용성, 시퀀스 길이, 메모리 압박, 단계별 병목 등이 변하면서 초기 실행 계획이 비효율적이 되는 문제를 해결한다.
  • Nereus는 비용 인식형 런타임으로서 RL 후학습 작업을 효율적인 실행 계획으로 자동 재조정하며, 저오버헤드 컨트롤러가 메모리 실행 가능한 전역 계획을 선택하고 실행 중인 작업을 기반으로 보정한 비용 모델로 전환을 승인한다.
  • 분산 상태를 모델-단계 단위의 탄력형 모델 유닛으로 표현하고 전역 전환 그래프를 이용해 이들 유닛의 변환과 GPU 전송 순서를 조율한다.
  • 실제 데이터 기반 시뮬레이션에서 온라인 TP/PP 적응은 고정 TP/PP 레이아웃 대비 평균 스텝 지연을 27.7% 단축했고, 1,000스텝 1,024 GPU 실행에서 6번의 전환이 전체 시간의 0.079%만 소비했다.
  • 8B PPO 모델 처리량 개선에서 OpenRLHF 대비 2.14~7.27배, Verl 대비 1.10~1.47배 향상을 달성했으며, 다양한 클러스터 환경에서 효과를 입증했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗