쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 24일 (목)까지932건
7건 · "하네스"조건 지우기 ×
001▲ 115 · 댓글 70비동기 도구 호출로 AI 에이전트 비용 40% 절감한 언리얼 에이전트언리얼 랩스가 AI 에이전트 실행 비용을 줄이기 위해 설계한 '언리얼 에이전트' 하네스를 공개했다.AI · 머신러닝 · Unreal Agent
비동기 도구 호출로 AI 에이전트 비용 40% 절감한 언리얼 에이전트

Key PointAI 에이전트의 운영 비용이 주요 과제인 상황에서 하네스 설계를 통해 실질적인 비용 절감을 달성한 오픈소스 솔루션이 등장했다.
핵심 요약
- 언리얼 랩스가 AI 에이전트 실행 비용을 줄이기 위해 설계한 '언리얼 에이전트' 하네스를 공개했다.
- 기존 에이전트들이 도구 호출 관리에 많은 토큰을 소비하는 문제를 해결하기 위해 비동기 방식의 도구 호출을 구현했다.
- 도구 실행을 백그라운드에서 처리하면서 곧바로 'in-progress' 상태를 기록함으로써 사용자 입력을 지연 없이 받을 수 있다.
- 벤치마크 결과 GPT-6 Astra에서 Codex 대비 40%, Pi 대비 20% 비용 절감을 달성했다.
- Go 라이브러리, 실행 도구, 벤치마크 러너 등이 포함된 SDK를 제공하며 도메인에 관계없이 사용 가능하다.
002▲ 13 · 댓글 2AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다.AI · 머신러닝 · Harness-Zero: Harness Distillation via Agent-as-Harness
AI 에이전트 성능 향상 노하우를 모델에 담는 기법 제안

Key Point특화된 외부 시스템 없이도 에이전트 성능을 크게 높일 수 있는 새로운 학습 방식이므로, 복잡한 작업을 자동화하려는 개발자에게 즉시 활용 가능한 기법이다.
핵심 요약
- 에이전트 성능을 높이는 최적화된 '하네스'(외부 시스템)를 모델 가중치에 증류하는 Harness-Zero 기법을 발표했다.
- 문제는 최적 하네스와 배포 환경의 하네스가 액션 스페이스와 정보 구조가 다르다는 점인데, 에이전트가 최적 하네스의 지도 하에 학생 응답을 교정해 훈련 데이터로 전환한다.
- 기존 코드 기반 접근법보다 에이전트 기반 하네스가 우수했으며, 배포 시 특화 하네스를 제거해도 기본 모델의 성공률이 23.3%에서 44.3%로 상승했다.
- 지식업무·도구 사용·과학 분야 실험에서 28개 행동 패턴 중 82.3%를 평균적으로 복구했다.
003▲ 112 · 댓글 57개인 하드웨어에서 돌리는 프론티어급 AI, 학계가 주도한다연구의 기본 단위가 논문에서 상호작용하는 오픈소스 생태계로 변했다.AI · 머신러닝 · Frontier AI on Your Own Hardware
개인 하드웨어에서 돌리는 프론티어급 AI, 학계가 주도한다
Key Point대형 모델을 개인 하드웨어에서 돌릴 수 있게 되면서 연구의 주도권이 GPU 자산이 많은 곳에서 혁신적 도구를 만드는 곳으로 이동하고 있기 때문이다.
핵심 요약
- 연구의 기본 단위가 논문에서 상호작용하는 오픈소스 생태계로 변했다.
- 에이전트로 인해 1년 걸리던 연구가 주 단위에 끝나면서 개별 논문 중심 연구는 더 이상 가치 있는 연구가 아니 된 것이다.
- 대학 연구팀이 24GB GPU 한 장에서 1250억 파라미터 모델을, MacBook에서 5500억 파라미터 모델을 실행할 수 있게 하는 프레임워크를 공개했다.
- 1.5비트 양자화로 같은 크기 모델을 1/10 메모리에 실행 가능하며 로컬 프로세스 수준의 응답 속도를 낸다.
- 에이전트 하네스는 사용자가 명령 한 줄로 대형 모델 최적화를 자동으로 진행하게 하며, 진행 과정 피드백 없이 스스로 문제를 해결한다.
- AI 자원이 풍부한 기업 연구소가 아닌 제한된 자원의 대학에서 차세대 연구가 일어날 것이라는 주장이다.
004▲ 100 · 댓글 15코딩 에이전트의 성능을 좌우하는 요소들코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.AI · 머신러닝 · An Empirical Study of Harness Design for Coding Agents
코딩 에이전트의 성능을 좌우하는 요소들

Key PointAI 개발자들이 코딩 에이전트를 더 효율적으로 구축하기 위한 구체적인 설계 원칙과 최적화 지점을 얻을 수 있다.
핵심 요약
- 코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.
- 컨텍스트 관리, 액션 스페이스, 계획 수립 등 세 가지 핵심 요소를 변수로 두고 네 가지 LLM을 대상으로 176가지 설정을 평가했다.
- 컨텍스트 창이 제한될수록 컨텍스트 관리의 중요도가 높아지며, 규칙 기반 삭제 후 LLM 기반 요약이 가장 효율적인 전략임을 확인했다.
- 강력한 모델일수록 계획 수립은 성능 향상보다 비용 절감에 역할을 하고, bash 능숙도가 높은 모델은 기정의된 도구 없이도 효과적으로 작동한다.
- 이번 분석은 모델 성능과 예산 제약에 맞춘 하네스 설계와 향후 구성 요소 평가 방법론을 제시한다.
005▲ 142 · 댓글 70실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다.AI · 머신러닝 · Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases
실제 기업 코드베이스로 AI 코딩 능력 평가하는 벤치마크 공개
Key Point기존의 합성 또는 공개 데이터셋 기반 벤치마크와 달리, 실제 프로덕션 코드베이스의 복잡성과 비즈니스 규칙이 포함된 평가 기준을 제시해 AI 코딩 에이전트의 현실적 능력을 가늠할 수 있다.
핵심 요약
- 실제 운영 중인 기업의 프라이빗 코드베이스에서 추출한 과제로 AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 'Real-SWE' 벤치마크를 발표했다.
- 세금 계산, 청구 시스템, 고객 마이그레이션 등 실제 비즈니스 영향을 미치는 작업을 포함하며, 회사별 고유한 코딩 관례와 레거시 시스템을 이해해야 한다.
- Fable 5.1이 38.8% 해결율로 1위, GPT-6 Astra가 33.8%, Gemini 3.8이 31.2%로 뒤를 이었다.
- 참고 해결책은 평균 11개 파일에 걸쳐 수정하며, 작업 지시사항은 평균 1,742자로 의도적으로 과소 정의되어 있다.
- NestJS, PostgreSQL, Kubernetes, Docker 등 실제 엔터프라이즈 개발 환경을 시뮬레이션하고, 각 모델-하네스 조합을 별도로 평가한다.
006당일 +184여러 AI 에이전트를 조직적으로 관리하는 배포판 firstmate한 명의 에이전트(first mate)와 대화하면 백그라운드에서 여러 크루 에이전트를 병렬로 실행하고 감독하는 agent distro다.AI · 머신러닝 · kunchenguid/firstmate · Shell
여러 AI 에이전트를 조직적으로 관리하는 배포판 firstmate

Key Point개발 작업을 여러 AI 에이전트가 병렬로 처리할 때 충돌 없이 독립적으로 진행하고, 단 하나의 에이전트와만 소통하며 나머지는 자동 감독받을 수 있는 구조를 제공한다.
핵심 요약
- 한 명의 에이전트(first mate)와 대화하면 백그라운드에서 여러 크루 에이전트를 병렬로 실행하고 감독하는 agent distro다.
- 각 작업은 독립된 git worktree에서 실행되므로 같은 저장소에서 동시 작업이 충돌하지 않는다.
- ship 작업은 PR이나 로컬 머지로 변경사항을 전달하고, scout 작업은 조사 리포트를 생성한다.
- tmux, Herdr, zellij 등 여러 세션 백엔드를 지원하며 모든 크루 에이전트의 작업을 실시간으로 볼 수 있다.
- Claude Code, Grok, Pi 등 검증된 AI 에이전트 하네스에서 작동하며, Git과 GitHub CLI 인증만으로 시작할 수 있다.
- 원격 secondmate 에이전트를 SSH로 실행하거나 X, Discord 멘션에 응답하는 Relay 옵션을 지원한다.
007당일 +727AI 에이전트를 위한 엔지니어링 시스템 ECC 공개Claude Code, Cursor 등 AI 에이전트가 코딩 작업을 체계적으로 수행하도록 돕는 오픈소스 프레임워크 ECC를 공개했다.AI · 머신러닝 · affaan-m/ECC · JavaScript
AI 에이전트를 위한 엔지니어링 시스템 ECC 공개

Key PointAI 코딩 에이전트의 품질과 안정성을 높이려는 개발자라면, 프롬프트 튜닝 대신 체계적인 엔지니어링 프레임워크를 도입할 수 있는 선택지가 생겼다.
핵심 요약
- Claude Code, Cursor 등 AI 에이전트가 코딩 작업을 체계적으로 수행하도록 돕는 오픈소스 프레임워크 ECC를 공개했다.
- 계획 수립, 테스트 검증, 자체 코드 리뷰, 메모리 관리, 보안 기능을 통합한 에이전트 하네스 성능 최적화 시스템이다.
- MIT 라이선스의 무료 오픈소스 프로젝트이며, 개인 저장소용 Pro 버전은 월 $19부터 제공된다.
- Node.js 18 이상, Git, Claude Code 2.1 이상이 필요하며 npm 또는 Claude Code 플러그인으로 설치 가능하다.
- 공식 출처(GitHub, npm, GitHub App, ecc.tools)에서만 설치할 것을 권고하며 비공식 배포판에는 악성코드 위험이 있다.