125억 개 파라미터 모델을 RTX 4090으로 초당 100토큰 속도로 실행
원제 Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s
166 포인트댓글 69
Key Point
소비자용 그래픽카드만으로 클라우드 서버 수준의 대규모 언어모델을 로컬에서 무료로 실행 가능해졌기 때문에, 개인 개발자와 중소 회사의 AI 접근 장벽이 크게 낮아진다.
핵심 요약
- Strata는 일반 게이밍 PC에서 125억 파라미터의 대규모 AI 모델 Qwen3.8-Flash-Next를 실행할 수 있게 해주는 오픈소스 소프트웨어다.
- RTX 5070(12GB)과 Ryzen 5 7600 조합에서 Q2_0 압축 모델 기준으로 초당 94토큰의 답변 생성 속도(32KB 문서 읽기 초당 2,650토큰)를 달성한다.
- RTX 3090(24GB) 같은 더 많은 VRAM을 가진 카드는 초당 100~140토큰 속도까지 낼 수 있다.
- 필요 사양은 NVIDIA RTX 20/30/40/50 시리즈 또는 AMD Radeon RX 7000/9000 시리즈 이상의 그래픽카드(12GB 이상 VRAM), 32GB 이상 RAM, 약 80GB 여유 디스크 공간이다.
- Strata는 그래픽카드에 자주 쓰는 1만여 개의 전문가(specialist)를 유지하고, 나머지 전문가는 RAM에 보관하며, 프로세서에서 처리하는 방식으로 작은 VRAM에 큰 모델을 적재한다.
- 설치는 START-HERE.bat(Windows) 또는 setup.sh(Linux) 실행으로 자동으로 진행되며, 브라우저에서 http://127.0.0.1:8080으로 접속하여 사용한다.
- Chat, GPU/CPU/RAM 모니터링, 설정 화면을 제공하며, OpenAI 호환 API를 통해 Claude Code, Cursor, GitHub Copilot 같은 외부 앱과 연동 가능하다.
- 모델 크기는 Q2_0(가장 빠름)부터 IQ3_S(가장 정확), Coder(코딩 특화, 32GB 맞춤), Swift 1.5(빠른 응답), Unsloth UD-IQ4_XS 같은 옵션이 있으며, RAM 용량에 따라 권장 모델이 다르다.
- 초기 부팅 시 1~3분간 PC가 느려질 수 있으며(정상), 약 70GB 모델을 다운로드하고 35~55GB를 RAM에 적재한다.
- 소수 전문가를 미리 추측한 후 주 모델이 검증하는 방식으로 기존 방식 대비 1.6~1.8배 빠른 응답을 제공한다.
- 장문은 최대 8,192토큰씩 한 번에 처리하여 초당 1,000토큰 이상의 속도로 읽는다.
- Strata는 MIT 라이선스의 완전 무료 오픈소스이며, Qwen 팀의 모델을 ISTA-DASLab, UkisAI, Unsloth가 압축했고, llama.cpp/ggml의 일부를 사용한다.