PyTorch로 직접 구현한 최신 LLM 아키텍처 학습 저장소
원제 OpenArch – PyTorch implementations of modern LLM architectures
102 포인트댓글 23
Key Point
LLM 아키텍처의 세부 설계 차이를 명확히 읽고 비교하고 싶은 개발자라면, 프로덕션 코드의 복잡성 없이 각 선택지가 어떻게 구현되는지 바로 확인할 수 있다.
핵심 요약
- 최신 오픈소스 LLM들의 PyTorch 구현을 처음부터 손으로 직접 작성한 저장소로, 각 모델은 원논문과 기술 보고서를 참고해 구성했다.
- GPT-2, Llama 2/3/4, Qwen, Mistral, DeepSeek R1 등 11개 텍스트 모델과 PaliGemma, Qwen3 등 멀티모달 모델을 구현 중이며, 추가로 72개 아키텍처 전체 구현을 목표로 한다.
- 주의 메커니즘(MHA, GQA, MQA, MLA), 정규화(RMSNorm, QK-Norm), 위치 인코딩(RoPE, NoPE), MoE 라우팅 등 현대 LLM들이 사용하는 구조적 선택지를 명시적으로 표현해 비교하기 쉽게 했다.
- 프로덕션 최적화가 아닌 가독성을 우선하며, 각 모델이 하나의 Python 파일로 구성돼 원문 코드 분석보다 이해하기 쉽다.
- Apache 2.0 라이선스로 공개하며, 기여자를 모집 중이다.