쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 11일 (금)까지 270건
11건 · "벤치마크"조건 지우기 ×
001 03:10 ▲ 108 · 댓글 17 38억 파라미터 LLM을 998달러에 학습시키다 3.8B 파라미터 언어 모델을 65B 토큰으로 43시간 동안 학습해 CORE 벤치마크 0.384점을 달성했다. AI · 머신러닝 · Training a 3.8B LLM to 0.384 CORE for $998
38억 파라미터 LLM을 998달러에 학습시키다 Key Point 개인 개발자가 수천 달러 규모로 의미 있는 규모의 언어 모델을 학습할 수 있는 현실적인 경로와 구체적 최적화 기법을 보여주며, AI 인프라 설계의 중요성을 강조하는 사례입니다.
핵심 요약
3.8B 파라미터 언어 모델을 65B 토큰으로 43시간 동안 학습해 CORE 벤치마크 0.384점을 달성했다. B200 GPU 8개 렌탈 비용 $998로 GPT-2 대비 훨씬 나은 성능을 구현했으며, 같은 비용대의 nanochat d32보다 의미 있게 우수하다. Trapezoidal LR 스케줄, Muon 옵티마이저, ClimbMix 데이터셋, FP8 학습, 1024 토큰 컨텍스트 등 다섯 가지 최적화로 858M 모델의 실패 사례에서 개선했다. YAML 기반 설정 프레임워크를 구축해 코드 수정 없이 옵티마이저나 데이터셋을 한 줄로 교체할 수 있게 하는 등 인프라 설계에 중점을 뒀다. 초기 시행착오에서 FineWeb-Edu와 높은 학습률 설정 문제를 발견했고, 학습 후반부까지 손실이 감소하는 trapezoidal 스케줄로 해결했다. 002 03:10 ▲ 136 · 댓글 67 Cognition, 코딩 AI 모델 SWE-2 공개 Cognition이 최신 소프트웨어 엔지니어링 모델 SWE-2를 발표했다. AI · 머신러닝 · Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
Cognition, 코딩 AI 모델 SWE-2 공개 Key Point 소프트웨어 엔지니어링 AI의 성능-비용 경계가 어떻게 달라졌는지, 그리고 이전 모델의 과잉 탐색 문제를 어떻게 해결했는지 알 수 있다.
핵심 요약
Cognition이 최신 소프트웨어 엔지니어링 모델 SWE-2를 발표했다. FrontierCode 1.1 Main에서 50.0% 점수를 기록해 Fable 5.1과 1포인트 차이나며, 비용은 64% 더 저렴하다. 다중 삼조 파라미터 규모에서 강화학습을 처음 적용해 모든 성능-비용 트레이드오프를 최적화했다. Kimi K33(2.8T 파라미터) 기반으로 선형 비용 페널티와 개선된 RL 보상 베이스라인을 적용했다. SWE-2는 SWE-1.7 대비 같은 작업을 58% 적은 스텝으로 81% 낮은 비용에 수행하며, Devin Desktop·CLI·Web·Fusion에서 즉시 이용 가능하다. 003 03:10 ▲ 172 · 댓글 62 GPT-6 Astra, 루프 트랜스포머, 숨겨진 추론 메커니즘 OpenAI의 GPT-6 Astra는 코딩, 수학, 3D 렌더링 등 거의 모든 카테고리에서 GPT-5.6을 능가하며, 특히 ARC-AGI-3 벤치마크에서 99.9% 정확도를 기록했다. AI · 머신러닝 · GPT-6 Astra, looped transformers, and hidden reasoning
GPT-6 Astra, 루프 트랜스포머, 숨겨진 추론 메커니즘 Key Point GPT-6 Astra의 구체적인 성능 향상(특히 추론과 컴퓨터 조작 능력)을 이해해야 차세대 모델의 방향을 파악할 수 있습니다.
핵심 요약
OpenAI의 GPT-6 Astra는 코딩, 수학, 3D 렌더링 등 거의 모든 카테고리에서 GPT-5.6을 능가하며, 특히 ARC-AGI-3 벤치마크에서 99.9% 정확도를 기록했다. 컴퓨터 사용 능력이 뛰어나 로컬 PC의 그래픽 소프트웨어(페인트, 블렌더 등)를 마우스와 UI로 직접 조작할 수 있으며, 이는 데모 영상의 시각적 임팩트로 주목받고 있다. 루프 트랜스포머(반복적 깊이) 및 숨겨진 추론 메커니즘에 대한 건축학적 루머가 있으며, 이 글은 이러한 기술 혁신과 최근 연구를 분석한다. 004 03:10 ▲ 112 · 댓글 33 27.4KB WebGPU 기반 범용 코드 구문 강조기 공개 Vercel Labs의 Shu Ding이 gpu-lexer라는 언어 불특정 구문 강조기를 개발했다. 웹 · 프론트엔드 · 27.5KB language-agnostic WebGPU syntax highlighter
27.4KB WebGPU 기반 범용 코드 구문 강조기 공개 Key Point 대규모 코드 파일의 구문 강조가 필요한 개발자들에게 극도로 가볍고 빠른 대안을 제공한다.
핵심 요약
Vercel Labs의 Shu Ding이 gpu-lexer라는 언어 불특정 구문 강조기를 개발했다. WebGPU 기반 작은 모델이 로컬과 파일 전체 문맥을 결합해 소스코드를 단어, 공백, 줄바꿈, 기호 등으로 분해한 뒤 각 부분의 타입을 레이블링한다. 학습하지 않은 언어도 주변 맥락에서 타입을 추측하도록 설계되었다. 번들 크기는 27.4KB로 언어별 모델이 필요한 Shiki(최대 991.5KB)나 Highlight.js(240.4KB)보다 훨씬 작다. 벤치마크에서 대용량 파일(5.56M 자)을 처리할 때 402ms로 다른 도구(Shiki 29.6s, Highlight.js 1.29s)보다 10배 이상 빠르다. 학습 데이터에 없는 파일에서 Shiki 대비 토큰 레이블 일치도는 90.35%다. 005 21:11 당일 +276 AI를 위한 메모리 엔진, 로컬 실행 가능한 Supermemory AI 대화 간 기억을 유지하는 메모리·컨텍스트 엔진으로, LongMemEval, LoCoMo, ConvoMem 등 주요 벤치마크에서 1위를 차지했다. AI · 머신러닝 · supermemoryai/supermemory · TypeScript
AI를 위한 메모리 엔진, 로컬 실행 가능한 Supermemory Key Point AI 어시스턴트가 대화 간 정보를 잊는 근본적인 문제를 해결하는 메모리 인프라로, 개발자들이 자신의 AI 도구에 장기 메모리를 추가하거나 에이전트에 통합할 수 있는 API를 제공한다.
핵심 요약
AI 대화 간 기억을 유지하는 메모리·컨텍스트 엔진으로, LongMemEval, LoCoMo, ConvoMem 등 주요 벤치마크에서 1위를 차지했다. 95% Recall@15을 달성하면서 컨텍스트를 99.4% 압축하고, 사용자 프로필을 약 50ms 내에 생성한다. Claude Code, Cursor, VS Code 등 AI 도구에 플러그인이나 MCP 서버로 통합되어 대화 전체에서 지속적인 메모리를 제공한다. RAG, 파일 처리, Google Drive·Gmail·Notion 등 커넥터, PDF·이미지·비디오·코드 등 멀티모달 추출기를 포함한 완전한 컨텍스트 스택을 제공한다. 로컬 실행이 가능하며 구성 없이 한 번에 배포 가능하고, Ollama와 함께 완전 오프라인 운영도 지원한다. 006 11:10 당일 +705 AI 에이전트가 웹브라우저를 조작하는 오픈소스 프레임워크 Browser Use는 AI 에이전트가 인간처럼 웹브라우저를 조작할 수 있게 해주는 Python 라이브러리다. AI · 머신러닝 · browser-use/browser-use · Python
AI 에이전트가 웹브라우저를 조작하는 오픈소스 프레임워크 Key Point 웹 자동화 업무가 많은 개발자와 기업에게 AI 에이전트 활용의 새로운 길을 열어주며, 기존 자동화 도구보다 훨씬 유연한 방식을 제시한다.
핵심 요약
Browser Use는 AI 에이전트가 인간처럼 웹브라우저를 조작할 수 있게 해주는 Python 라이브러리다. 폼 작성, 데이터 추출, 작업 자동화 등 웹 태스크를 자연어로 명령하면 에이전트가 자동으로 수행한다. 오픈소스 버전은 무료이며 자신의 LLM을 선택해 커스터마이징할 수 있다. 클라우드 기반 호스팅 버전도 제공되며, Browser Use는 Odysseys 벤치마크에서 87.4%의 정확도로 1위를 기록했다. Python 라이브러리, CLI, 에이전트 통합 등 다양한 방식으로 사용 가능하며 Gmail, Slack, Notion 등 1000개 이상의 통합을 지원한다. 007 08:12 ▲ 211 · 댓글 112 280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동 삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다. AI · 머신러닝 · Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동 Key Point 280억 개 파라미터를 가진 대규모 언어모델을 품질 손상 없이 소비자용 하드웨어에서 구동하는 것이 가능함을 보여주며, 가정용 AI 인프라의 현실적 가능성을 시사한다.
핵심 요약
삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다. 모델의 1.45TB 전문가 가중치는 SSD에서 동적으로 로드되며, 프리필 단계에서 각 레이어의 전문가를 8배 중복 읽기하면서 약 6.3분의 지연이 발생한다. 기존 공개 벤치마크(0.68토큰/s)보다 43% 빠른 성능을 기록했으며, 드라이브 개수에 따라 1개 52%, 2개 73%, 3개 90%의 속도 향상을 보인다. MIT 라이선스 Deltafin은 모델 품질을 절대 훼손하지 않고 전체 16개 전문가를 모두 사용하며, 스트리밍 모드(215GB 시작) 또는 풀 다운로드 모드(1.7TB)로 설치 가능하다. 프리필 재읽기 문제는 식별되었고 수정 계획이 있지만 아직 구현되지 않았으며, 개발진은 이를 순수한 연구 실험이자 자체 호스팅 AI의 한계를 탐색하는 프로젝트로 규정했다. 008 08:12 ▲ 218 · 댓글 107 Qwen 3.8 27B, 4비트 양자화까지는 성능 유지 원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다. AI · 머신러닝 · Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
Qwen 3.8 27B, 4비트 양자화까지는 성능 유지 Key Point 로컬에서 대형 언어 모델을 실행할 때 양자화 정도별로 실제 성능이 어떻게 달라지는지 벤치마크로 확인한 첫 실측 데이터라, 제한된 GPU 메모리 환경에서 모델 선택을 할 때 직접적인 참고 기준이 된다.
핵심 요약
원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다. RTX 4090(24GB) 같은 소비자 GPU에서도 약 64k 토큰 컨텍스트를 남기며 실행 가능하다. 2비트 양자화는 조금 낮은 성능을 보이지만 10.7GB로 감소하고 실용적 수준을 유지한다. 1비트 양자화에서는 GPQA Diamond 벤치마크에서 무작위 추측 수준으로 성능이 붕괴되며, 긴 추론일수록 악화된다. 저자는 $3,000 규모의 GPU 비용을 들여 GPQA Diamond, IFBench, Terminal-Bench 2.1 세 벤치마크에서 실측했다. 추론 난이도(effort level)에 따라 점수가 크게 달라지며, xhigh 설정에서 1비트는 빈 답변을 반환하는 경우까지 생긴다. 009 08:12 ▲ 117 · 댓글 68 AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교 GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다. AI · 머신러닝 · I tested 10 model/harness combinations on the same Three.js task
AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교 Key Point Three.js 같은 복잡한 프론트엔드 작업에서 모델별 성능과 비용 효율이 크게 달라지므로, 개발자가 선택할 때 참고할 수 있는 실제 측정 데이터가 제공된다.
핵심 요약
GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다. 같은 프롬프트로 다양한 모델(Qwen, Luna, Sol, Astra)과 프레임워크(Codex, OpenCodeOpen 등)를 조합해 성능을 측정했다. 처리 시간은 8분부터 41분까지 편차가 컸고, 생성된 토큰 수는 모델마다 크게 달랐다. 총 비용(OpenRouter 환율 기준)은 GLM 5.3이 약 $0.015로 가장 저렴했고, Astra 6.0은 약 $4.04로 가장 비쌌다. 캐시 활용도는 대부분 78~95% 범위였고, 일부 모델은 도구 호출 오류가 발생했거나 브라우저에서 결과물을 열지 못했다. 010 00:10 ▲ 339 · 댓글 320 Opus 5, 벤치마크 최적화의 대가 Opus 5는 이전 버전보다 성능이 우수하지만, 사용자들은 실제 작업에서 더 어렵다고 평가합니다. AI · 머신러닝 · Why does Opus 5 feel worse to work with?
Opus 5, 벤치마크 최적화의 대가 Key Point Hacker News에서 고인기를 얻은 이유는 Claude 모델의 실용성 문제를 직접 경험한 개발자들의 공감을 샀기 때문입니다.
핵심 요약
Opus 5는 이전 버전보다 성능이 우수하지만, 사용자들은 실제 작업에서 더 어렵다고 평가합니다. Opus 5는 명확하지 않은 의도에 대해 확인 요청을 하지 않고 가정을 바탕으로 행동하는 경향이 있습니다. 벤치마크 점수 최적화와 자기개선형 AI 개발 압박이 모호한 상황에서 대담한 결정을 내리도록 모델을 선택하게 만든 것으로 보입니다. 011 00:10 ▲ 15 · 댓글 3 알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능 Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다. AI · 머신러닝 · Qwen 3.8 27B is out: open weights, best local dense model yet
알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능 Key Point 로컬에서 구동 가능한 고성능 오픈소스 모델로, Hacker News 커뮤니티에서 배포 용이성과 벤치마크 성과에 주목받고 있다.
핵심 요약
Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다. 27B 매개변수 모델로 코딩, 에이전트 작업, 멀티모달 이해 능력을 갖추고 262K 네이티브 컨텍스트를 지원한다. 터미널 코딩 벤치마크 73.0점, SWE-bench Pro 61.7점 등 기존 모델을 능가하는 성능을 보인다.