쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 29일 (화)까지 1217건
6건 · "MLX"조건 지우기 ×
001 21:11 당일 +160 Apple Silicon과 NVIDIA에서 LLM을 OpenAI 호환 API로 서빙하는 TensorFold TensorFold는 Apple Silicon(MLX) 및 NVIDIA GPU에서 텍스트 모델을 OpenAI 호환 API 엔드포인트로 서빙하는 Python 기반 도구다. AI · 머신러닝 · ashhart/TensorFold · Python
Apple Silicon과 NVIDIA에서 LLM을 OpenAI 호환 API로 서빙하는 TensorFold Key Point Apple Silicon 개발자가 로컬에서 고성능 LLM 추론을 OpenAI 호환 방식으로 실행할 수 있으며, NVIDIA GPU와 동일한 API로 통일된 배포가 가능해진다.
핵심 요약
TensorFold는 Apple Silicon(MLX) 및 NVIDIA GPU에서 텍스트 모델을 OpenAI 호환 API 엔드포인트로 서빙하는 Python 기반 도구다. Nemotron 3.5 Lightning, Qwen3.8-27B, Qwen3.8 Flash Next, GLM-5.3-Flash, Gemma 4 등 여러 모델을 지원하며, 각 모델은 자체 커널과 드래프트 검증을 포함한다. MLX 백엔드는 M1~M5 칩에서 row-exact simd_qmm 디코더로 4비트/그룹64 가중치를 읽고, CUDA 백엔드는 단일 또는 2-rank 텐서 병렬 처리를 지원한다. 전체 요약 12문장 읽기 → 002 22:29 새 버전 Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. AI · 머신러닝 · ollama/ollama@v0.34.4
Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Key Point 로컬 LLM 실행 환경의 가장 대중적인 도구인 Ollama의 안정성과 성능이 개선되어, 특히 Apple Silicon 사용자의 추론 속도와 안정성이 크게 향상된다.
핵심 요약
Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. 대규모 로컬 라이브러리에서 발생하던 간헐적인 '모델 미발견' 오류를 수정했다. macOS 앱이 ChatGPT나 Codex 실행 여부 확인 시 응답 없음 상태가 되는 문제를 해결했다. 전체 요약 6문장 읽기 → 003 06:11 새 버전 Ollama v0.34.3 릴리스, 모델 추론 제어 API 추가 모델의 사고(thinking) 제어 레벨을 설정할 수 있는 GET /api/show 엔드포인트 추가되었다. AI · 머신러닝 · ollama/ollama@v0.34.3
Ollama v0.34.3 릴리스, 모델 추론 제어 API 추가 Key Point LLM의 추론 깊이를 제어하는 thinking 기능이 API 레벨에서 관리 가능해져, 개발자가 프로덕션 서비스에서 모델의 사고 능력과 응답 속도를 유연하게 조절할 수 있다.
핵심 요약
모델의 사고(thinking) 제어 레벨을 설정할 수 있는 GET /api/show 엔드포인트 추가되었다. CLI와 API에서 각 모델의 thinking 기능과 기본값을 조회할 수 있으며, 올마 클라우드 모델은 ollama.com에서도 직접 확인 가능하다. Nemotron H 비전 모델이 Apple Silicon의 MLX 백엔드에서 정식 지원된다. 전체 요약 5문장 읽기 → 004 09:10 ▲ 150 · 댓글 49 27B 모델을 5.9GB로 압축, 98% 성능 유지 Qwen 3.8 27B 기반의 Ternary Bonsai 2 27B를 출시했으며, 삼진법 가중치와 FP16 그룹 스케일링으로 5.9GB 용량에 압축했다. AI · 머신러닝 · Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint
27B 모델을 5.9GB로 압축, 98% 성능 유지 Key Point 로컬 기기에서 대형 모델을 실용적으로 실행할 수 있는 경계가 넓어지며, 에너지 효율과 배포 가능성의 균형이 어디까지 갈 수 있는지를 보여주기 때문입니다.
핵심 요약
Qwen 3.8 27B 기반의 Ternary Bonsai 2 27B를 출시했으며, 삼진법 가중치와 FP16 그룹 스케일링으로 5.9GB 용량에 압축했다. 전체 정밀도 모델 대비 9배 이상 작으면서 98.2% 성능을 유지하며, 262K 토큰 컨텍스트 윈도우와 멀티모달 기능을 지원한다. 추론, 코딩, 비전, 에이전트 도구 사용 등에서 성능 저하를 최소화해 장시간 작업이나 다단계 처리에 유리하다. 전체 요약 6문장 읽기 → 005 21:11 당일 +104 YAML 한 줄로 LLM 학습하는 Soup, 4GB GPU에서 8B 모델 실행 Soup는 YAML 설정 파일 하나로 LLM 파인튜닝과 포스트트레이닝을 실행하는 CLI 도구다. AI · 머신러닝 · MakazhanAlpamys/Soup · Python
YAML 한 줄로 LLM 학습하는 Soup, 4GB GPU에서 8B 모델 실행 Key Point 로컬 저사양 GPU에서도 대규모 언어모델을 효율적으로 학습할 수 있는 실용적인 도구로, 인프라 복잡성을 제거하고 싶은 개발자와 연구진이 참고해야 한다.
핵심 요약
Soup는 YAML 설정 파일 하나로 LLM 파인튜닝과 포스트트레이닝을 실행하는 CLI 도구다. 레이어 스트리밍 기술로 8B 모델을 4GB 노트북 GPU에서 학습할 수 있으며, RTX 3050에서 119.6 tok/s, 3.32GB 피크 메모리로 동작한다. SSH 설정 없이 로컬 GPU에서 QLoRA로 훈련 가능하며, 배치 크기와 양자화 등을 자동으로 처리한다. 전체 요약 6문장 읽기 → 006 21:11 당일 +3,274 ElevenLabs 대체 오픈소스, 로컬에서 음성 변환·더빙·받아쓰기 VoiceStudio는 646개 언어를 지원하는 오픈소스 음성 생성 도구로, 음성 클로닝·음성 디자인·동영상 더빙·받아쓰기·오디오북 제작을 모두 로컬에서 처리한다. 오픈소스 · 도구 · debpalash/VoiceStudio · Python
ElevenLabs 대체 오픈소스, 로컬에서 음성 변환·더빙·받아쓰기 Key Point 클라우드 서비스 의존 없이 모든 음성 작업을 로컬에서 처리할 수 있는 완성도 높은 오픈소스가 등장했으며, 엔진 유연성과 다국어 지원이 개발자와 콘텐츠 제작자에게 실질적인 선택지가 된다.
핵심 요약
VoiceStudio는 646개 언어를 지원하는 오픈소스 음성 생성 도구로, 음성 클로닝·음성 디자인·동영상 더빙·받아쓰기·오디오북 제작을 모두 로컬에서 처리한다. TTS 16개, ASR 11개 엔진을 탑재했으며 엔진 간 전환이 자유롭다. 계정·API 키·구독료 없이 자신의 하드웨어에서 동작하며, macOS·Windows·Linux·Docker를 지원한다. 전체 요약 6문장 읽기 →