쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 15일 (화)까지456건
4건 · "PyTorch"조건 지우기 ×
001▲ 102 · 댓글 23PyTorch로 직접 구현한 최신 LLM 아키텍처 학습 저장소최신 오픈소스 LLM들의 PyTorch 구현을 처음부터 손으로 직접 작성한 저장소로, 각 모델은 원논문과 기술 보고서를 참고해 구성했다.AI · 머신러닝 · OpenArch – PyTorch implementations of modern LLM architectures
PyTorch로 직접 구현한 최신 LLM 아키텍처 학습 저장소

Key PointLLM 아키텍처의 세부 설계 차이를 명확히 읽고 비교하고 싶은 개발자라면, 프로덕션 코드의 복잡성 없이 각 선택지가 어떻게 구현되는지 바로 확인할 수 있다.
핵심 요약
- 최신 오픈소스 LLM들의 PyTorch 구현을 처음부터 손으로 직접 작성한 저장소로, 각 모델은 원논문과 기술 보고서를 참고해 구성했다.
- GPT-2, Llama 2/3/4, Qwen, Mistral, DeepSeek R1 등 11개 텍스트 모델과 PaliGemma, Qwen3 등 멀티모달 모델을 구현 중이며, 추가로 72개 아키텍처 전체 구현을 목표로 한다.
- 주의 메커니즘(MHA, GQA, MQA, MLA), 정규화(RMSNorm, QK-Norm), 위치 인코딩(RoPE, NoPE), MoE 라우팅 등 현대 LLM들이 사용하는 구조적 선택지를 명시적으로 표현해 비교하기 쉽게 했다.
- 프로덕션 최적화가 아닌 가독성을 우선하며, 각 모델이 하나의 Python 파일로 구성돼 원문 코드 분석보다 이해하기 쉽다.
- Apache 2.0 라이선스로 공개하며, 기여자를 모집 중이다.
002▲ 111 · 댓글 60AMD GPU에서 CUDA 애플리케이션 실행하는 도구 공개ZLUDA와 AMD HIP/ROCm을 조합해 Windows의 AMD GPU에서 CUDA 기반 애플리케이션을 실행할 수 있는 스택을 구현했다.하드웨어 · 시스템 · CUDA for AMD on Windows
AMD GPU에서 CUDA 애플리케이션 실행하는 도구 공개

Key PointAMD GPU 사용자들이 CUDA 기반 머신러닝 프레임워크(PyTorch 등)와 모델을 자신의 하드웨어에서 직접 돌릴 수 있게 되는 경로가 제시됐기 때문이다.
핵심 요약
- ZLUDA와 AMD HIP/ROCm을 조합해 Windows의 AMD GPU에서 CUDA 기반 애플리케이션을 실행할 수 있는 스택을 구현했다.
- 현재 AMD Radeon RX 9060 XT(gfx1200)만 검증되었으며, 다른 AMD GPU는 호환성 보장이 없는 후보 상태다.
- nvcuda, cuBLAS, cuBLASLt, cuSPARSE, cuFFT 등의 CUDA API는 통과했고, 2,216,347개 파라미터의 PPO 신경망 학습도 동작 확인했다.
- 자동 설치 스크립트와 진단 도구를 제공하며, 검증된 환경에서 업스트림 경로의 성능이 커스텀 오버레이보다 약 3% 빠르다.
- cuDNN은 현재 Windows HIP SDK의 ROCm AI 라이브러리 부재로 사용 불가이며, ZLUDA는 완전한 CUDA 구현이 아니다.
003당일 +528트랜스포머 생태계의 중심 - Hugging Face Transformers 라이브러리Transformers는 NLP, 비전, 오디오, 비디오, 멀티모달 등 다양한 분야의 최신 머신러닝 모델을 정의하고 학습·추론하는 프레임워크입니다.AI · 머신러닝 · huggingface/transformers · Python
트랜스포머 생태계의 중심 - Hugging Face Transformers 라이브러리

Key PointTransformers는 최신 AI 모델들의 표준 정의 기준이 되어 있으며, 기업과 개발자가 프로덕션 환경에서 모델을 활용할 때 필수 생태계입니다.
핵심 요약
- Transformers는 NLP, 비전, 오디오, 비디오, 멀티모달 등 다양한 분야의 최신 머신러닝 모델을 정의하고 학습·추론하는 프레임워크입니다.
- 라이브러리가 정의한 모델은 Axolotl, Unsloth, DeepSpeed 등 대부분의 학습 프레임워크와 vLLM, SGLang, TGI 같은 추론 엔진에서 호환됩니다.
- Hugging Face Hub에 100만 개 이상의 사전학습 모델 체크포인트가 공개되어 있어 즉시 활용 가능합니다.
- Pipeline API를 통해 텍스트, 음성, 이미지, 멀티모달 작업을 단순한 인터페이스로 처리할 수 있습니다.
- Python 3.10 이상, PyTorch 2.5 이상에서 동작하며 소스 설치를 통해 최신 버전을 사용할 수 있습니다.
004▲ 143 · 댓글 9NEC V20 마이크로코드 복호화 성공CPU 에뮬레이터 개발자가 NEC V20 칩의 고해상도 사진(56억 픽셀)을 촬영한 뒤 마이크로코드 ROM을 추출했다.하드웨어 · 시스템 · Decoding the NEC V20 Microcode
NEC V20 마이크로코드 복호화 성공

Key Point과거 8088 마이크로코드 복호화로 문을 열었던 저수준 CPU 에뮬레이션이 이제 V20까지 확대되면서, 진정한 사이클 정확도의 역사 CPU 에뮬레이터 구현이 가능해졌다.
핵심 요약
- CPU 에뮬레이터 개발자가 NEC V20 칩의 고해상도 사진(56억 픽셀)을 촬영한 뒤 마이크로코드 ROM을 추출했다.
- ROM 배열은 258x116 크기로 29,928비트를 담고 있으며, 29비트 단위 마이크로코드 1,032개가 저장되어 있다.
- 마이크로코드 비트를 수동으로 분류한 1,000개 샘플로 CNN(합성곱 신경망)을 학습시켰고, 약 6세대 만에 99% 이상의 정확도를 달성했다.
- PyTorch를 이용한 이 방법은 29,928개 비트 전체를 자동으로 추출하는 데 성공했으며, 이를 통해 V20의 사이클 정확도 높은 에뮬레이션이 가능해졌다.