쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 15일 (화)까지456건
3건 · "ROCm"조건 지우기 ×
001▲ 111 · 댓글 60AMD GPU에서 CUDA 애플리케이션 실행하는 도구 공개ZLUDA와 AMD HIP/ROCm을 조합해 Windows의 AMD GPU에서 CUDA 기반 애플리케이션을 실행할 수 있는 스택을 구현했다.하드웨어 · 시스템 · CUDA for AMD on Windows
AMD GPU에서 CUDA 애플리케이션 실행하는 도구 공개

Key PointAMD GPU 사용자들이 CUDA 기반 머신러닝 프레임워크(PyTorch 등)와 모델을 자신의 하드웨어에서 직접 돌릴 수 있게 되는 경로가 제시됐기 때문이다.
핵심 요약
- ZLUDA와 AMD HIP/ROCm을 조합해 Windows의 AMD GPU에서 CUDA 기반 애플리케이션을 실행할 수 있는 스택을 구현했다.
- 현재 AMD Radeon RX 9060 XT(gfx1200)만 검증되었으며, 다른 AMD GPU는 호환성 보장이 없는 후보 상태다.
- nvcuda, cuBLAS, cuBLASLt, cuSPARSE, cuFFT 등의 CUDA API는 통과했고, 2,216,347개 파라미터의 PPO 신경망 학습도 동작 확인했다.
- 자동 설치 스크립트와 진단 도구를 제공하며, 검증된 환경에서 업스트림 경로의 성능이 커스텀 오버레이보다 약 3% 빠르다.
- cuDNN은 현재 Windows HIP SDK의 ROCm AI 라이브러리 부재로 사용 불가이며, ZLUDA는 완전한 CUDA 구현이 아니다.
002당일 +2,774ElevenLabs 대체 오픈소스, 로컬에서 음성 변환·더빙·받아쓰기VoiceStudio는 646개 언어를 지원하는 오픈소스 음성 생성 도구로, 음성 클로닝·음성 디자인·동영상 더빙·받아쓰기·오디오북 제작을 모두 로컬에서 처리한다.오픈소스 · 도구 · debpalash/VoiceStudio · Python
ElevenLabs 대체 오픈소스, 로컬에서 음성 변환·더빙·받아쓰기

Key Point클라우드 서비스 의존 없이 모든 음성 작업을 로컬에서 처리할 수 있는 완성도 높은 오픈소스가 등장했으며, 엔진 유연성과 다국어 지원이 개발자와 콘텐츠 제작자에게 실질적인 선택지가 된다.
핵심 요약
- VoiceStudio는 646개 언어를 지원하는 오픈소스 음성 생성 도구로, 음성 클로닝·음성 디자인·동영상 더빙·받아쓰기·오디오북 제작을 모두 로컬에서 처리한다.
- TTS 16개, ASR 11개 엔진을 탑재했으며 엔진 간 전환이 자유롭다.
- 계정·API 키·구독료 없이 자신의 하드웨어에서 동작하며, macOS·Windows·Linux·Docker를 지원한다.
- CUDA·Apple Silicon MPS/MLX·ROCm·CPU 등 다양한 컴퓨팅 환경을 지원한다.
- 데스크톱 앱·로컬 REST/WebSocket API·OpenAI 호환 오디오 API를 제공한다.
- 현재 Electron 기반의 데스크톱 앱으로 재작성 중이며 AGPL-3.0 라이선스로 배포된다.
003▲ 143 · 댓글 53vLLM이 AMD GPU에서 추측 디코딩 지원vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.AI · 머신러닝 · Speculative Decoding in vLLM on AMD GPUs
vLLM이 AMD GPU에서 추측 디코딩 지원

Key PointLLM 추론 성능 최적화를 위한 주요 기법이 AMD GPU에서 실제 구현되어, 장기 생성 작업의 처리량 개선 가능성을 보여준다.
핵심 요약
- vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.
- 추측 디코딩은 경량 드래프트 모듈이 여러 토큰을 먼저 제안하고 타겟 모델이 한 번에 검증하는 방식으로, 기존 자동회귀 디코딩보다 모델 통과 횟수를 줄인다.
- 표준 방식은 토큰 하나당 모델 실행 1회가 필요하지만, 추측 디코딩은 여러 드래프트 토큰이 검증을 통과하면 단일 모델 실행으로 여러 토큰을 커밋할 수 있다.
- Native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark 등 5가지 드래프팅 방식을 검토했으며, 방식·제안 길이·모델 종류·수용 동작 등에 따라 처리량 개선 효과가 달라진다.
- 드래프트 토큰이 거부되면 거부 지점 이후의 토큰들은 폐기되고 타겟 모델의 결과로 생성을 계속한다.