쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 24일 (목)까지 932건
16건 · "도구 호출"조건 지우기 ×
001 21:11 당일 +186 AI 코딩 에이전트의 학습 기록을 공유하는 오픈소스 플랫폼 Beacon은 Claude Code, Cursor, Codex 등 20개 이상의 AI 코딩 도구에서 세션 이력을 수집하는 메모리 계층이다. AI · 머신러닝 · Asymptote-Labs/agent-beacon · Go
AI 코딩 에이전트의 학습 기록을 공유하는 오픈소스 플랫폼 Key Point 한 에이전트가 해결한 문제를 다른 도구에서 반복 학습하지 않도록 에이전트 간 지식 공유를 가능하게 하는 인프라이며, 코딩 워크플로우의 누적 개선을 구현한다.
핵심 요약
Beacon은 Claude Code, Cursor, Codex 등 20개 이상의 AI 코딩 도구에서 세션 이력을 수집하는 메모리 계층이다. 워크플로우, 디버깅 패턴, 수정 사항 같은 유용한 지식을 식별해 향후 에이전트가 재사용할 수 있게 변환한다. OpenTelemetry 기반의 통일된 이벤트 형식으로 프롬프트, 응답, 도구 호출, 파일 편집, MCP 활동, 토큰 사용량을 기록한다. 로컬 기반이며 JSONL 형식으로 데이터를 저장해 특정 도구에 종속되지 않도록 설계했다. macOS, Linux, Windows에서 설치 가능하며 로컬 대시보드로 세션 이력을 검색하고 분석할 수 있다. 002 21:11 당일 +201 코드베이스를 지식그래프로 변환하는 AI 코딩 엔진 일반적인 저장소는 밀리초 단위로, 리눅스 커널(28M LOC)은 3분 안에 전체 인덱싱하는 고속 코드 인텔리전스 엔진 MCP 서버. AI · 머신러닝 · DeusData/codebase-memory-mcp · C
코드베이스를 지식그래프로 변환하는 AI 코딩 엔진 Key Point AI 개발자가 코드 이해에 드는 토큰과 시간을 획기적으로 줄일 수 있어 LLM 코딩 에이전트의 효율성을 크게 높일 수 있다.
핵심 요약
일반적인 저장소는 밀리초 단위로, 리눅스 커널(28M LOC)은 3분 안에 전체 인덱싱하는 고속 코드 인텔리전스 엔진 MCP 서버. Tree-sitter AST 분석으로 162개 언어를 지원하며, Python·TypeScript·Go·Rust 등 11개 언어는 LSP 의미 분석으로 함수·클래스·호출 체인의 지식그래프 생성. 구조화된 쿼리에 1ms 이내 응답하고, 파일 단위 탐색 대비 토큰을 120배 줄이며 도구 호출을 2.1배 감소시키는 것으로 평가됨. 단일 네이티브 바이너리로 배포되며 의존성·런타임·API 키가 없고, macOS·Linux·Windows 자동 설치 지원. 로컬 처리만 진행되므로 코드가 외부로 나가지 않으며, localhost:9749에서 3D 그래프 시각화 제공. 17개 MCP 도구로 검색·아키텍처 분석·데드코드 탐지·쿠버네티스 매니페스트 색인 등 지원. 003 09:11 ▲ 115 · 댓글 70 비동기 도구 호출로 AI 에이전트 비용 40% 절감한 언리얼 에이전트 언리얼 랩스가 AI 에이전트 실행 비용을 줄이기 위해 설계한 '언리얼 에이전트' 하네스를 공개했다. AI · 머신러닝 · Unreal Agent
비동기 도구 호출로 AI 에이전트 비용 40% 절감한 언리얼 에이전트 Key Point AI 에이전트의 운영 비용이 주요 과제인 상황에서 하네스 설계를 통해 실질적인 비용 절감을 달성한 오픈소스 솔루션이 등장했다.
핵심 요약
언리얼 랩스가 AI 에이전트 실행 비용을 줄이기 위해 설계한 '언리얼 에이전트' 하네스를 공개했다. 기존 에이전트들이 도구 호출 관리에 많은 토큰을 소비하는 문제를 해결하기 위해 비동기 방식의 도구 호출을 구현했다. 도구 실행을 백그라운드에서 처리하면서 곧바로 'in-progress' 상태를 기록함으로써 사용자 입력을 지연 없이 받을 수 있다. 벤치마크 결과 GPT-6 Astra에서 Codex 대비 40%, Pi 대비 20% 비용 절감을 달성했다. Go 라이브러리, 실행 도구, 벤치마크 러너 등이 포함된 SDK를 제공하며 도메인에 관계없이 사용 가능하다. 004 03:11 ▲ 167 · 댓글 120 OpenAI, 신흥 AI 모델 Jev를 빠르게 따라잡을 수 있을까 TypeSafe의 Jev는 LLM의 토큰 확률 분포를 이용해 boolean, choice, score 같은 분류 작업을 수행하는 새로운 방식의 모델로 급속도로 채택되고 있다. AI · 머신러닝 · OpenAI is well positioned to fast-follow Jev
OpenAI, 신흥 AI 모델 Jev를 빠르게 따라잡을 수 있을까 Key Point OpenAI의 기술 역량과 기존 인프라가 Jev의 추격을 어렵게 만드는 요소가 무엇인지, 그리고 TypeSafe가 경쟁 우위를 지키려면 어디에 집중해야 하는지를 이해하는 데 필요하다.
핵심 요약
TypeSafe의 Jev는 LLM의 토큰 확률 분포를 이용해 boolean, choice, score 같은 분류 작업을 수행하는 새로운 방식의 모델로 급속도로 채택되고 있다. OpenAI는 도구 호출과 응답 생성 같은 기능에서 이미 수년간 토큰 단위 마이크로 분류기를 암묵적으로 사용해왔으며, 이 기술을 Jev의 방식으로 명시적으로 학습하고 패키징할 수 있다. OpenAI가 같은 기술을 습득하면 Jev를 빠르게 복제할 수 있을 뿐 아니라, 기존 모델과 에이전트에 통합해 더 빠르고 저렴한 응답, 보안 강화, 모델 선택 최적화 같은 추가 가치를 제공할 수 있다. TypeSafe의 경쟁력은 학습 데이터와 학습 방식에 있으며, 이를 보호하지 못하면 OpenAI의 진입에 취약할 수 있다. 005 09:10 ▲ 101 · 댓글 48 프롬프트는 해법이 아니다, LLM 에이전트 운영의 현실 LLM 에이전트를 프로덕션 환경에서 안정적으로 운영하려면 구조화된 출력이나 도구 호출도 요청의 일부가 예기치 않게 실패한다. AI · 머신러닝 · Prompts aren’t Real
프롬프트는 해법이 아니다, LLM 에이전트 운영의 현실 Key Point 프로덕션 LLM 에이전트 개발자라면 프롬프트 튜닝이 근본 해결책이 아님을 알아야 할 때이다.
핵심 요약
LLM 에이전트를 프로덕션 환경에서 안정적으로 운영하려면 구조화된 출력이나 도구 호출도 요청의 일부가 예기치 않게 실패한다. 모델이 지정된 길이나 형식을 지키지 않고 무작위 텍스트를 반환하거나, 같은 필드명을 다르게 부르면 갑자기 동작하는 등 근본적인 불안정성이 존재한다. LLM의 신뢰성 문제를 측정하려면 pass^k 방식으로 같은 작업을 반복 실행해 실패율을 모니터링해야 한다. 프롬프트는 새 명령을 추가할 때마다 모델의 기존 동작을 예측 불가능하게 변경하므로, 단순히 도메인 전문가가 작성한 프롬프트를 추가하는 방식으로는 확장 불가능하다. 에이전트의 목소리나 브랜드 톤 같은 요구사항은 프롬프트 엔지니어링만으로 일관되게 달성할 수 없으며, 다른 제약 조건 메커니즘이 필요하다. 006 21:11 당일 +158 무게 9분의 1, 성능 98% 유지하는 경량 언어모델 Bonsai 2 공개 PrismML이 극도로 압축한 언어모델 Bonsai 2 27B를 공개했으며, 5.9GB 크기로 노트북이나 단일 GPU에서 구동된다. AI · 머신러닝 · PrismML-Eng/Bonsai-demo · Shell
무게 9분의 1, 성능 98% 유지하는 경량 언어모델 Bonsai 2 공개 Key Point 극도로 경량화한 27B급 언어모델이 고성능을 유지하면서 개발자 기계에서 직접 실행 가능해지면서, 모델 압축 기술의 실용적 한계를 넓혔다.
핵심 요약
PrismML이 극도로 압축한 언어모델 Bonsai 2 27B를 공개했으며, 5.9GB 크기로 노트북이나 단일 GPU에서 구동된다. FP16 대비 98.2% 수준의 성능을 유지하면서 원본의 약 9분의 1 크기를 달성했고, 수학은 반올림 수준의 정확도, 코딩은 기준 모델과 동일 수준이다. 3중 값(ternary) 가중치 기반이며 262K 토큰 콘텍스트, 비전 기능, OpenAI 방식의 도구 호출, 추론 기능을 지원한다. 가중치당 1.75비트 크기의 PTQ1_0 포장과 프롬프트 처리 속도가 빠른 PQ2_0 포장을 제공하며, 기본값은 후자다. Mac(Metal), Linux/Windows(CUDA/Vulkan/ROCm), CPU에서 로컬 실행 가능하고 두 개 명령으로 설정 완료된다. 이전 버전인 Bonsai(1비트)와 Ternary-Bonsai도 27B, 8B, 4B, 1.7B 크기로 계속 제공된다. 007 21:11 당일 +139 AI 에이전트와 인간이 함께 일하는 오픈소스 워크스페이스 Multica AI 코딩 에이전트를 팀원처럼 이슈에 할당하면, 에이전트가 자동으로 작업을 진행하고 진행 상황을 보고하며 최종 결과를 리뷰를 위해 제출하는 오픈소스 워크스페이스다. AI · 머신러닝 · multica-ai/multica · Go
AI 에이전트와 인간이 함께 일하는 오픈소스 워크스페이스 Multica Key Point 개별 터미널에 흩어져 있던 AI 에이전트들을 하나의 워크스페이스에 모아 팀 협업 방식으로 운영할 수 있게 하며, 자동화와 감시 기능을 통해 AI 작업의 투명성과 제어력을 확보할 수 있다.
핵심 요약
AI 코딩 에이전트를 팀원처럼 이슈에 할당하면, 에이전트가 자동으로 작업을 진행하고 진행 상황을 보고하며 최종 결과를 리뷰를 위해 제출하는 오픈소스 워크스페이스다. Claude Code, Codex, Cursor 등 26개의 에이전트 CLI를 지원하며, 사용자가 제어하는 런타임에서 코드를 실행하고 각 에이전트에 이름과 역할을 부여해 팀 보드에 표시할 수 있다. 이슈 할당, 정기 스탠드업·감사·리포트 자동화, 대화형 작업 시작, 프로젝트 단위 컨텍스트 관리 등의 기능을 제공한다. 모든 도구 호출, 명령어, 에러를 타임스탬프와 함께 기록하고, 각 실행의 토큰 사용량을 추적하며, 리뷰 게이트를 통해 사람의 승인 없이는 배포되지 않도록 보장한다. GitHub, GitLab, Gitea 등 모든 Git 호스트를 지원하고, Docker Compose나 Helm으로 자체 인프라에 설치할 수 있으며, 웹·데스크톱·모바일에서 접근 가능하다. Slack, Lark, DingTalk 등 메신저 연동을 지원하고, 역할 기반 접근 제어와 상세한 보안 모델을 제공한다. 008 08:25 당일 +432 통합 LLM API·에이전트 런타임 Pi 공개 OpenAI, Anthropic, Google 등 여러 LLM 제공자를 하나의 API로 통합하는 라이브러리와 에이전트 런타임, 인터랙티브 CLI 도구를 TypeScript로 제공한다. AI · 머신러닝 · earendil-works/pi · TypeScript
통합 LLM API·에이전트 런타임 Pi 공개 Key Point AI 에이전트 개발 시 멀티 LLM 통합과 권한 관리 전략, 공급망 보안을 어떻게 구현했는지 알 수 있는 오픈소스 프로젝트입니다.
핵심 요약
OpenAI, Anthropic, Google 등 여러 LLM 제공자를 하나의 API로 통합하는 라이브러리와 에이전트 런타임, 인터랙티브 CLI 도구를 TypeScript로 제공한다. Pi는 도구 호출 기능과 상태 관리를 갖춘 에이전트 런타임, 터미널 UI 라이브러리, 코딩 작업용 에이전트 CLI 등 여러 패키지로 구성되어 있다. 기본적으로 사용자 프로세스의 권한으로 실행되며 권한 제한 시스템은 포함하지 않지만, 컨테이너나 샌드박스로 격리할 수 있다. npm 의존성을 정확한 버전으로 고정하고 스스로 검증하며, 릴리스 전 격리된 환경에서 설치 테스트를 실행해 공급망 보안을 강화했다. MIT 라이선스이며 오픈소스 프로젝트 작업 세션 데이터를 수집해 실제 작업으로 에이전트 성능을 개선하는 것을 목표로 한다. 009 21:11 당일 +102 AI 에이전트의 버전 관리 플랫폼 Atlas 공개 코딩 에이전트가 작성한 모든 코드 변경을 '체크포인트'로 기록하며, 각 커밋과 함께 프롬프트, 도구 호출, 추론 과정을 함께 저장한다. AI · 머신러닝 · pacifio/atlas · Rust
AI 에이전트의 버전 관리 플랫폼 Atlas 공개 Key Point AI 에이전트가 작성한 코드의 의도와 과정을 추적할 수 없다는 개발 환경의 근본적인 문제를 해결하며, 여러 AI 도구를 하나의 플랫폼에서 협력시킬 수 있는 첫 번째 시도다.
핵심 요약
코딩 에이전트가 작성한 모든 코드 변경을 '체크포인트'로 기록하며, 각 커밋과 함께 프롬프트, 도구 호출, 추론 과정을 함께 저장한다. Claude Code, Codex, Atlas 자체 에이전트 등 여러 AI 에이전트를 같은 코드베이스에서 나란히 실행하고, 에이전트 전환 시에도 이전 대화 맥락을 유지할 수 있다. 마크다운 형식의 노트와 에이전트 컨텍스트를 로컬에 저장하며, 어떤 에디터에서도 열 수 있도록 설계했다. 기본적으로 로컬에서만 작동하고, 팀 동기화가 필요할 때만 클라우드 연동을 선택할 수 있다. macOS에서 지원되며, Rust와 Tauri 기반으로 빌드되어 Linux와 Windows에서도 빌드 가능하지만 테스트되지 않았다. 010 21:11 당일 +131 AI 코딩 용어를 쉬운 말로 설명하는 오픈소스 사전 AI 코딩의 난해한 용어들을 일반인도 이해할 수 있도록 평문(plain English)으로 설명하는 오픈소스 저장소다. AI · 머신러닝 · mattpocock/dictionary-of-ai-coding · TypeScript
AI 코딩 용어를 쉬운 말로 설명하는 오픈소스 사전 Key Point AI 개발에서 자주 마주치는 비용 증가, 프롬프트 동작 불안정, 컨텍스트 저하 같은 문제들의 원인을 이해하려면 기본 용어를 알아야 하기 때문이다.
핵심 요약
AI 코딩의 난해한 용어들을 일반인도 이해할 수 있도록 평문(plain English)으로 설명하는 오픈소스 저장소다. 모델, 토큰, 컨텍스트 윈도우, 에이전트, 도구 호출 등 AI 개발의 핵심 개념을 체계적으로 분류하고 정리했다. VC 자금이 난해함을 유지하려는 경제 체계에 대항하며, 기본 용어만 익혀도 AI 코딩의 불확실함이 사라진다는 철학을 담았다. 각 섹션은 모델, 세션·컨텍스트·턴, 도구·환경, 실패 모드, 인수인계, 메모리·스티어링, 작업 패턴 등 7개 주제로 구성되어 있다. 011 12:10 ▲ 103 · 댓글 51 LRU 캐시 정책, 기존 논문보다 더 견고했다 실제 Claude Code 세션 393개(요청 68,266건)와 Mooncake 요청 23,608건을 재현해 LRU를 이길 방법을 3가지로 시도했으나 모두 실패했다. 인프라 · 데브옵스 · LRU is harder to beat than the KV-cache papers suggest
LRU 캐시 정책, 기존 논문보다 더 견고했다 Key Point 생성형 LLM 에이전트 서빙에서 캐시 정책을 최적화하려는 엔지니어들이 설계 선택을 할 때, 최근 학술 논문의 주장이 실제 프로덕션 워크로드에 얼마나 적용되는지 확인할 수 있다.
핵심 요약
실제 Claude Code 세션 393개(요청 68,266건)와 Mooncake 요청 23,608건을 재현해 LRU를 이길 방법을 3가지로 시도했으나 모두 실패했다. 용량 부족 상황에서 캐시 재계산의 주요 원인은 세션 만료(TTL)가 아니라 2초 간격의 도구 호출 루프였고, 5분 TTL은 실제로 발동되지 않았다. 재계산 토큰의 33.1%는 10초 이내 요청에서 발생했고, 5분 이상 대기 후 요청은 17.5%에 불과해 기존 논문의 핵심 가정이 실제 워크로드와 다르다. SGLang과 vLLM의 라딕스 트리 구조 내 LRU 구현이 단순 블록 LRU와 거의 동일한 성능(0.02pp 차이)을 보여 기존 최적화가 실무에서는 거의 효과가 없다. 생성형 LLM 에이전트 서빙에서 크로스 요청 KV 캐시 프리픽스 공유가 가장 큰 성능 이득이지만, LRU를 대체할 더 나은 정책이 실제로 존재하지 않을 수 있다. 012 21:11 ▲ 218 · 댓글 31 OpenRouter 사용할 때 마주칠 9가지 함정 OpenRouter를 통해 같은 모델을 호스팅하는 20개 제공자들이 벤치마크에서 크게 달라지는데, 예를 들어 DeepSeek V4 Flash의 도구 호출 성능이 제공자별로 58~81%까지 20포인트 이상 차이난다. AI · 머신러닝 · So you want to use OpenRouter?
OpenRouter 사용할 때 마주칠 9가지 함정 Key Point 같은 모델의 가중치를 사용해도 제공자별로 성능, 기능 호환성, 에러 처리가 크게 달라서 OpenRouter를 사용하는 개발자는 제공자 선택과 에러 대응 코드를 신중하게 고려해야 한다.
핵심 요약
OpenRouter를 통해 같은 모델을 호스팅하는 20개 제공자들이 벤치마크에서 크게 달라지는데, 예를 들어 DeepSeek V4 Flash의 도구 호출 성능이 제공자별로 58~81%까지 20포인트 이상 차이난다. 일부 비전 모델은 같은 모델 가중치를 쓰는데도 특정 제공자에서는 이미지를 인식하지 못하거나 오류를 반환하면서도 200 OK를 보내는 문제가 발생한다. reasoning.effort 파라미터가 모든 제공자에서 작동하지 않으며, 동일한 프롬프트에 대해 제공자별로 추론 토큰 생성이 일관되지 않다. 양자화 필터(fp8, fp4)로 제공자를 선별해도 품질 보장이 안 되며, 실제 벤치마크 성능이 선언된 정밀도와 무관하게 나타난다. 모델이 생성한 도구 호출이 텍스트로 남겨지거나, 제공자 파서가 이를 구조화된 형식으로 변환하지 못해 사용자 코드에서 직접 파싱해야 한다. 추론 모델이 모든 응답을 reasoning_content 필드에 넣고 content를 null로 반환하거나, 200 OK 응답이 실제 답변 없이 반환되는 경우가 발생한다. 013 18:10 ▲ 294 · 댓글 217 Astra, 코드 품질은 뛰어나지만 개발 효율성은 의문 OpenAI의 Astra 모델은 장시간 작업 완료와 이미지 이해 능력이 뛰어나지만, 실제 소프트웨어 엔지니어링에는 아직 어려움이 있다. AI · 머신러닝 · Astra for Coding: Why Are We Doing This Again?
Astra, 코드 품질은 뛰어나지만 개발 효율성은 의문 Key Point 뛰어난 AI 모델도 실제 개발 작업에는 불필요한 코드 생성, 낮은 가독성, 비효율적인 문제 해결이라는 근본적 한계를 드러내고 있다.
핵심 요약
OpenAI의 Astra 모델은 장시간 작업 완료와 이미지 이해 능력이 뛰어나지만, 실제 소프트웨어 엔지니어링에는 아직 어려움이 있다. 모델이 35시간에 40억 토큰을 소비한 자동화 실험에서 실질적 결과물을 내지 못했다. Astra는 도구 호출 시 불필요한 Python 코드를 과도하게 생성하는데, 이는 읽기 어렵고 효율성이 낮다. 모니터링이 없는 작업에서 더욱 복잡한 패턴을 보이며, Python에서 Bash로 Node.js를 실행한 뒤 PowerShell을 호출하는 식의 비합리적 체인을 만든다. 토큰 효율성을 위해 생성한 Python 코드 스니펫이 실제 저장되는 코드에까지 유입되어 코드 품질을 해친다. AI 엔지니어링이 생산성 향상 없이 경쟁만 심화하는 '내권(involution)' 현상을 반영하고 있다는 우려를 제기한다. 014 15:10 ▲ 209 · 댓글 126 OpenAI 에이전트 API 공개, 자동화된 작업 수행 가능 OpenAI가 Agents API를 공개했으며, 애플리케이션이 LLM 기반 에이전트를 통해 복잡한 작업을 자동화할 수 있다. AI · 머신러닝 · OpenAI Agents API
OpenAI 에이전트 API 공개, 자동화된 작업 수행 가능 Key Point 개발자가 LLM 기반 자동화 시스템을 구축할 때 인프라 관리 부담을 크게 줄일 수 있게 되었고, API 기반 에이전트 구현이 표준화되는 전환점이 될 수 있다.
핵심 요약
OpenAI가 Agents API를 공개했으며, 애플리케이션이 LLM 기반 에이전트를 통해 복잡한 작업을 자동화할 수 있다. 에이전트는 세션 단위로 운영되며 OpenAI가 인프라, 오케스트레이션, 컨텍스트 관리를 담당하고 개발자는 도구와 실행 환경을 제공한다. 샌드박스에서 코드 실행, 파일 편집, MCP 서버 연결, 아티팩트 생성이 가능하다. 웹 검색, 프로그래밍 도구 호출, 다중 에이전트 위임(최대 4개 동시 실행) 등의 기능을 지원한다. 요금은 선택한 모델의 API 요금과 OpenAI 도구 표준 요금, 호스팅 샌드박스는 표준 컨테이너 요금이 적용된다. 기존 세션을 재개하거나 실행 중에 에이전트를 제어할 수 있으며, 웹훅으로 완료 상태를 추적할 수 있다. 015 21:11 당일 +190 LLM 토큰 소비 90% 줄이는 CLI 프록시 RTK 공개 Rust 바이너리 단일 파일로 제공되는 CLI 프록시로, bash 명령 출력을 필터링해 LLM이 읽는 데이터를 최대 90% 감축한다. 기타 · rtk-ai/rtk · Rust
LLM 토큰 소비 90% 줄이는 CLI 프록시 RTK 공개 Key Point LLM 에이전트의 컨텍스트 비용을 크게 줄이는 실용적인 도구이며, 개발자 워크플로우에서 자동으로 적용되는 훅 방식으로 추가 설정 없이 토큰 절감을 극대화할 수 있다. ai
핵심 요약
Rust 바이너리 단일 파일로 제공되는 CLI 프록시로, bash 명령 출력을 필터링해 LLM이 읽는 데이터를 최대 90% 감축한다. ls, git status, grep, cargo test 등 100개 이상의 명령을 지원하며, 트리 포맷으로 변환·중복 제거·그룹화 등 4가지 전략을 적용한다. 10ms 이하의 오버헤드로 동작하며, 의존성 없이 Homebrew, Cargo, 사전빌드 바이너리로 설치할 수 있다. bash 도구 호출에 자동으로 작동하는 훅 기반 시스템을 제공하며, Claude Code의 Read·Grep 같은 내장 도구는 자동 지원되지 않아 명시적으로 rtk 명령을 사용해야 한다. 출력 크기 감소로 Claude의 프롬프트 캐시 작동을 유지하면서 캐시 쓰기·읽기 비용도 낮춘다. 016 08:12 ▲ 117 · 댓글 68 AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교 GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다. AI · 머신러닝 · I tested 10 model/harness combinations on the same Three.js task
AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교 Key Point Three.js 같은 복잡한 프론트엔드 작업에서 모델별 성능과 비용 효율이 크게 달라지므로, 개발자가 선택할 때 참고할 수 있는 실제 측정 데이터가 제공된다.
핵심 요약
GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다. 같은 프롬프트로 다양한 모델(Qwen, Luna, Sol, Astra)과 프레임워크(Codex, OpenCodeOpen 등)를 조합해 성능을 측정했다. 처리 시간은 8분부터 41분까지 편차가 컸고, 생성된 토큰 수는 모델마다 크게 달랐다. 총 비용(OpenRouter 환율 기준)은 GLM 5.3이 약 $0.015로 가장 저렴했고, Astra 6.0은 약 $4.04로 가장 비쌌다. 캐시 활용도는 대부분 78~95% 범위였고, 일부 모델은 도구 호출 오류가 발생했거나 브라우저에서 결과물을 열지 못했다.