캑터스 니들 3: 8~29MB 경량 모델이 DeepSeek V4 Flash 수준 성능
Key Point
에지 기기 AI의 핵심 병목이던 모델 크기와 성능의 트레이드오프를 근본적으로 바꾸는 아키텍처로, 온디바이스 AI 구현이 현실화될 수 있음을 보여줍니다.
핵심 요약
- 8~29MB 크기의 경량 자동화 모델 캑터스 니들 3을 공개했습니다.
- Laddered Simple Attention Networks 아키텍처로 같은 크기 트랜스포머 대비 토큰당 2배 적은 연산을 사용합니다.
- 4계층 모델을 파인튜닝하면 DeepSeek V4 Flash와 같은 성능을 내며, 라즈베리파이5에서 초당 400~4000토큰을 처리합니다.
- 함수 호출, 데이터 추출, 텍스트 임베딩을 지원하며 스마트홈, 로봇, 웨어러블 등 임베디드 기기에 적용됩니다.
- 10배 큰 모델보다 모바일 함수 호출에서, 2~3배 큰 모델과는 데이터 추출에서 더 나은 성능을 보입니다.
- Python 패키지로 설치 가능하며 HuggingFace에서 추론 엔진을 내려받아 오프라인으로 동작합니다.