AI 토큰 가격, 2년마다 절반으로 떨어진다
Key Point
AI 추론 비용이 지수함수적으로 내려가면서 개발자의 LLM 활용 방식과 비즈니스 모델이 근본적으로 달라질 시점이 임박했기 때문이다.
핵심 요약
- 머신러닝 인텔리전스 가격이 연 수 배수 규모로 계속 내려가고 있으며, GPU 효율이 2년마다 2배씩 증가하는 등 여러 방면에서 개선이 진행 중이다.
- 작은 모델도 더 많은 토큰을 사용하지만, 전체 비용은 떨어지고 있으며, 2025년에 비해 2026년의 모델들은 비용이 2배 정도 저렴해졌다.
- vLLM, NVIDIA, Intel 등의 추론 엔진(inference engine)들이 15개월에 40%, 최대 2.4배의 효율 개선을 보이고 있다.
- 향후 1-2년 내 LLM이 인프라처럼 컴퓨팅의 모든 부분에 통합될 것으로 예상되며, 3-6년 내 최고 수준의 모델이 일반 하드웨어에서 로컬로 실행될 수 있을 것으로 보인다.
- 토큰 개수보다는 품질과 접근성이 AI 사용의 제한 요인이 되기 시작할 것으로 전망된다.