쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 26일 (토)까지1085건
3건 · "평가 방법"조건 지우기 ×
001▲ 16 · 댓글 2LLM 코딩 벤치마크, 실제 실력 평가 아닌 암기 성공 가능성SWE-bench 등 저장소 수준 코딩 벤치마크는 학습 데이터에 반복 사용된 인기 오픈소스 저장소 기반이라 데이터 유출 문제를 안고 있다.AI · 머신러닝 · Schrödinger's Code Repository: Have LLMs Learned SWE-bench or Memorized It?
LLM 코딩 벤치마크, 실제 실력 평가 아닌 암기 성공 가능성

Key PointLLM 코딩 평가 벤치마크가 실제 실력이 아닌 암기된 패턴 재인식을 측정하고 있을 가능성을 실증적으로 보여, SWE-bench 성능 신뢰도 문제를 제기한다.
핵심 요약
- SWE-bench 등 저장소 수준 코딩 벤치마크는 학습 데이터에 반복 사용된 인기 오픈소스 저장소 기반이라 데이터 유출 문제를 안고 있다.
- 강한 성능이 실제 저장소 추론 능력이 아니라 표준화된 저장소 단서 암기를 반영할 가능성이 있다.
- SchrodingerRepo 평가 프레임워크를 제안하며, 정적 저장소 표현 대신 평가 시점에 동적으로 인스턴스화된 저장소를 사용한다.
전체 요약 7문장 읽기 → 002▲ 100 · 댓글 15코딩 에이전트의 성능을 좌우하는 요소들코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.AI · 머신러닝 · An Empirical Study of Harness Design for Coding Agents
코딩 에이전트의 성능을 좌우하는 요소들

Key PointAI 개발자들이 코딩 에이전트를 더 효율적으로 구축하기 위한 구체적인 설계 원칙과 최적화 지점을 얻을 수 있다.
핵심 요약
- 코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.
- 컨텍스트 관리, 액션 스페이스, 계획 수립 등 세 가지 핵심 요소를 변수로 두고 네 가지 LLM을 대상으로 176가지 설정을 평가했다.
- 컨텍스트 창이 제한될수록 컨텍스트 관리의 중요도가 높아지며, 규칙 기반 삭제 후 LLM 기반 요약이 가장 효율적인 전략임을 확인했다.
전체 요약 5문장 읽기 → 003당일 +256AI 에이전트 구축 원리부터 실전까지 완전 가이드Datawhale 커뮤니티가 에이전트 개발자를 위한 무료 오픈소스 교육 프로젝트 'Hello-Agents'를 공개했다.AI · 머신러닝 · datawhalechina/hello-agents · Python
AI 에이전트 구축 원리부터 실전까지 완전 가이드

Key Point2025년 '에이전트 원년'에 접어든 시점에서 기초부터 실전까지 체계적으로 AI 에이전트를 배우고 구축할 수 있는 실제 프로젝트 기반의 무료 교재를 얻을 수 있기 때문이다.
핵심 요약
- Datawhale 커뮤니티가 에이전트 개발자를 위한 무료 오픈소스 교육 프로젝트 'Hello-Agents'를 공개했다.
- 기초 이론(ReAct, Plan-and-Solve, Reflection 등)부터 실제 구축까지 16개 장으로 구성되었으며, AI 네이티브 에이전트 시스템의 구조와 핵심 원리를 다룬다.
- AutoGen, AgentScope, LangGraph 같은 주류 프레임워크 활용법과 직접 에이전트 프레임워크를 만드는 방법을 포함한다.
전체 요약 6문장 읽기 →