Mac M4에서 오프라인 추론하는 Laya CoreML 구현

Key Point
M4 Mac과 같은 모바일 칩에서 오프라인으로 LLM을 실행하는 구체적인 구현 사례로, 클라우드 의존성 없이 저지연 추론이 필요한 개발자들에게 참고할 수 있는 방법이다.
핵심 요약
- Mac M4에서 Laya 언어 모델을 CoreML로 변환하여 초당 45개 의사결정 처리 가능하게 구현했다.
- 온라인 연결 없이 로컬에서 추론하며 Python 환경에서 쉽게 설치·실행할 수 있다.
- 메모리 사용량은 초기 560MB에서 최대 778MB 정도로 M4 칩의 효율적인 실행을 보여준다.
- Cloudflare Workers 같은 엣지 환경에서도 배포 가능한 형태로 API 서버 구성이 시연됐다.