작은 AI 모델, 로컬에서도 충분히 돈다

Key Point
스마트폰·노트북 같은 개인 기기에서 AI를 충분히 돌릴 수 있다는 실증 자료로, 향후 AI 서비스 인프라 구조의 전환을 시사한다.
핵심 요약
- 20억 개 파라미터 이하의 소형 LLM이 클라우드 최고급 모델 대비 88.7% 정확도로 실제 질의응답에 성공했다.
- Apple M4 Max 같은 로컬 가속기에서 대화형 속도로 모델을 실행할 수 있으며, 에너지 효율성을 '와트당 지능도(IPW)'로 측정할 수 있다는 지표를 제안했다.
- 2023~2025년 2년간 IPW가 5.3배 개선되었고, 로컬에서 처리 가능한 질의 비중이 23.2%에서 71.3%로 증가했다.
- 클라우드 가속기 대비 로컬 가속기가 동일 모델 실행 시 최소 1.4배 낮은 에너지 소비를 기록했다.
- 연구팀은 100만 건의 실제 사용자 질의를 분석해 로컬 추론이 중앙 집중식 인프라 의존도를 상당히 줄일 수 있음을 입증했다.