8GB GPU에서 처음부터 학습하는 미니 AGI 공개
Key Point
개인용 GPU에서 처음부터 훈련하고 계속 학습하는 언어 모델을 만드는 기술적 접근이 가능함을 보여주며, 하드웨어 제약 속에서도 지속적인 학습 구조를 구현할 수 있는 새로운 아키텍처 패턴을 제시한다.
핵심 요약
- 8GB VRAM 단일 GPU에서 처음부터 학습 가능한 바이트 레벨 언어 모델로, 가중치를 디스크에 저장했다가 필요할 때만 로드해 매개변수 수를 VRAM이 아닌 여유 디스크 공간으로 제한한다.
- 훈련 중 용량이 부족하면 자동으로 확장하고, 불필요한 부분은 정리하며, 지속적 학습(continual learning)을 통해 재앙적 망각 없이 스트림 형태의 데이터에서 계속 배운다.
- 두 개의 밀집 블록과 최대 24번 반복되는 재귀 블록으로 구성되며, 각 적용마다 공유 풀에서 자신의 전문가 8개를 선택하는 라우팅 방식을 사용한다.
- 적응형 깊이 구조로 쉬운 입력은 적은 계산으로, 어려운 입력은 더 많은 계산을 수행하며, 정지 헤드가 각 깊이에서 답변이 변할 것 같으면 멈춘다.
- 현재 작은 실험 수준이며 개인 데이터로 계속 학습 가능한 진정한 개인 모델을 목표로 하지만, 가중치는 아직 공개하지 않았고 첫 번째 말뭉치 통과를 진행 중이다.