쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 17일 (목)까지585건
4건 · "SIMD"조건 지우기 ×
001▲ 133 · 댓글 25.NET 11의 성능 개선 공개, 작은 최적화들 누적마이크로소프트가 .NET 11의 성능 개선 내용을 상세히 공개했다.인프라 · 데브옵스 · Performance Improvements in .NET 11
.NET 11의 성능 개선 공개, 작은 최적화들 누적

Key Point매년 누적되는 성능 개선을 구체적인 최적화 사례와 벤치마크로 확인할 수 있어, .NET 기반 애플리케이션 개발자들이 버전 업그레이드의 실질적 효과를 평가하고 최적화 기법을 학습하는 데 도움이 된다.
핵심 요약
- 마이크로소프트가 .NET 11의 성능 개선 내용을 상세히 공개했다.
- 바운드 체크 제거, 불필요한 할당 최적화, 잠금 제거, 루프 사이클 감소 등 수백 개의 개선이 이루어졌다.
- 각 개선은 JIT 컴파일러 최적화, 메모리 할당 감소, SIMD 활용 등 여러 영역에서 축적된 결과다.
- 제시된 벤치마크는 BenchmarkDotNet을 사용하며, .NET 10과 .NET 11을 직접 비교할 수 있도록 설계됐다.
- 개발자들이 직접 테스트할 수 있도록 자체 포함된 마이크로벤치마크 코드를 제공하고 있다.
002▲ 148 · 댓글 24Google의 범용 고속 정렬 알고리즘, C++ 표준 정렬보다 10배 빠름Google이 SIMD 벡터 명령어를 활용한 Quicksort 구현을 공개했으며, C++ std::sort보다 9~19배 빠르다.인프라 · 데브옵스 · Vectorized and performance-portable Quicksort (2022)
Google의 범용 고속 정렬 알고리즘, C++ 표준 정렬보다 10배 빠름

Key Point단일 포터블 구현으로 모든 주요 CPU 아키텍처에서 기존 방식보다 10배 빠른 정렬을 가능하게 했으므로, 데이터베이스와 대규모 데이터 처리 애플리케이션의 성능 혁신을 기대할 수 있다.
핵심 요약
- Google이 SIMD 벡터 명령어를 활용한 Quicksort 구현을 공개했으며, C++ std::sort보다 9~19배 빠르다.
- 단일 구현으로 AVX2, AVX-512, Arm NEON 등 6가지 명령어 세트를 지원하며, 플랫폼별 최적화 코드 재작성을 제거했다.
- 압축-저장(compress-store) 명령어를 활용한 파티셔닝으로 정렬 성능의 대부분을 차지하는 단계를 가속화했다.
- AVX-512 CPU에서 32비트 수 백만 개를 초당 1,123MB/s 속도로 정렬하며, Apple M1에서는 499MB/s 속도를 달성한다.
- 16~128비트 입력을 모두 지원하며, Apache2 라이선스로 GitHub에서 오픈소스로 공개되었다.
003▲ 100 · 댓글 25WebAssembly 런타임 성능 비교: 2024~2026년 추이2019년부터 추적해온 libsodium 암호화 벤치마크로 WebAssembly 런타임 성능 변화를 측정했다.웹 · 프론트엔드 · Performance of WebAssembly Runtimes in 2026
WebAssembly 런타임 성능 비교: 2024~2026년 추이
Key PointWebAssembly는 클라우드와 엣지 환경에서 계속 확대되는데, 이 연구는 주요 런타임들의 실제 성능 추세를 정량화했으므로 배포 환경 선택 시 근거가 된다.
핵심 요약
- 2019년부터 추적해온 libsodium 암호화 벤치마크로 WebAssembly 런타임 성능 변화를 측정했다.
- 2024년, 2025년, 2026년 각 런타임 최신 버전을 비교한 결과, Wasmer가 최고 성능을 기록했으며 WAVM, WAMR, Wasmtime이 근접했다.
- Wasmtime은 연평균 성능 향상(2.67배 → 2.54배 → 2.41배 네이티브 대비)을 보였고, Bun은 2026년에 2025년 대비 3배 빨라져 가파른 개선 추세를 보였다.
- WAMR의 AOT 모드는 이미 2025년부터 매우 빠른 상태(1.5배 네이티브 대비)를 유지했고, wasm2c 변환 방식도 우수한 옵션으로 평가됐다.
- wide_arithmetic, simd128 등 WebAssembly 새 명령어 지원 시 Wasmtime과 Wasmer는 특히 큰 성능 향상을 보였고, wide_arithmetic은 암호 코드에 특히 효과적이었다.
- Node와 Wazero는 2년간 뚜렷한 개선 없이 정체된 모습을 보였으며, 런타임 선택 시 지원하는 WebAssembly 기능 수준이 성능에 큰 영향을 미쳤다.
004당일 +115메모리 4분의 1만 써도 FAISS보다 빠른 벡터 검색 엔진Google의 TurboQuant 알고리즘 기반 Rust 벡터 인덱스로, Python 바인딩을 제공한다.AI · 머신러닝 · RyanCodrai/turbovec · Rust
메모리 4분의 1만 써도 FAISS보다 빠른 벡터 검색 엔진

Key Point벡터 데이터베이스의 메모리 사용과 검색 성능은 RAG 시스템의 핵심이므로, 기존 방식 대비 4배 더 효율적이면서 더 빠른 솔루션의 등장은 프로덕션 환경 선택에 직접 영향을 미친다.
핵심 요약
- Google의 TurboQuant 알고리즘 기반 Rust 벡터 인덱스로, Python 바인딩을 제공한다.
- 1,000만 문서 기준 float32 31GB가 4GB로 압축되며 FAISS IndexPQFastScan보다 빠른 검색 속도를 낸다.
- 온라인 인제스트 지원으로 훈련 단계 없이 벡터를 바로 색인하고, 증분 저장으로 변경분만 동기화한다.
- ARM의 NEON, x86의 AVX-512/AVX2 등 최적화된 SIMD 커널로 검색 시 3.4배 빠른 성능을 달성한다.
- 검색 시점의 필터링으로 허용된 ID 세트만 검색하며, 로컬 전용이라 개인정보보호와 지연시간이 중요한 RAG에 적합하다.
- LangChain, LlamaIndex, Haystack 등 주요 RAG 프레임워크 통합을 제공한다.