매직, 1조 파라미터 모델을 10배 저비용으로 학습하는 기법 공개

Key Point
알고리즘 효율성으로 대규모 모델을 저비용에 훈련하는 것이 가능함을 입증한 첫 구체적 사례로, 개발 리소스가 제한된 팀의 모델 개발 전략을 바꿀 수 있다.
핵심 요약
- Magic은 계산 효율을 10배 이상 개선한 사전학습 방법론을 발표했으며, DeepSeek V4 Pro Base와 동등한 성능을 GPT-3 학습량의 약 절반인 약 50배 적은 연산으로 달성했다.
- 추가로 10배 규모로 확장한 모델(약 $4M 비용)은 퍼플렉시티 평가에서 공개된 모든 오픈 기본 모델을 능가했으며, 동일 성능을 DeepSeek의 방식으로 훈련하려면 $100M 이상이 소요된다.
- 모델 아키텍처, 최적화기, 학습 목표, 데이터 큐레이션 등 수십 가지 변경 사항이 누적되어 효율성을 달성했으며, 작은 모델에서 효과 있는 기법이 대규모 모델에서는 작동하지 않는 경우도 발견했다.
- 코드, 수학 문제, 연구 논문 등 다양한 도메인에서 일반화 능력과 지식을 평가했으며, 학습 데이터와의 중복을 최소화하기 위해 다양한 필터링 기법을 적용했다.
- Magic은 장문맥 처리, 사전학습, 강화학습을 결합하여 초인적 코딩 에이전트를 구축하고 AI 연구개발 자동화를 목표로 하고 있다.