쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 2일 (금)까지1537건
3건 · "평가 방법론"조건 지우기 ×
001▲ 10 · 댓글 1문항반응이론으로 루브릭 보상 설계언어 작업은 자동 검증이 어려워 여러 기준으로 평가하는 루브릭을 사용하는데, 기존 방식은 기준별 점수를 단순합산한다.AI · 머신러닝 · Rubric Rewards from Item Response Theory
문항반응이론으로 루브릭 보상 설계

Key Point강화학습에서 복합적인 평가 기준을 다룰 때 더 효율적이고 차별화된 보상 신호를 만드는 새로운 이론 및 실제 방법론을 제시한다.
핵심 요약
- 언어 작업은 자동 검증이 어려워 여러 기준으로 평가하는 루브릭을 사용하는데, 기존 방식은 기준별 점수를 단순합산한다.
- 단순합산은 다른 평가 패턴이 같은 보상을 받고, 각 기준의 중요도를 고정값으로 인코딩해 판별력을 반영하지 못한다.
- 강화학습에서 평가 기준이 증가하면 판정자 요청이 선형으로 늘어나는 한계도 있다.
전체 요약 11문장 읽기 → 002당일 +101AI 에이전트용 메모리 인프라 Mem0, 토큰 효율성 47% 향상Mem0는 AI 에이전트와 애플리케이션을 위한 지속적인 메모리 계층을 제공하는 오픈소스 프로젝트로, 사용자 선호도와 세션·에이전트 상태를 학습해 개인화된 상호작용을 가능하게 한다.AI · 머신러닝 · mem0ai/mem0 · Python
AI 에이전트용 메모리 인프라 Mem0, 토큰 효율성 47% 향상

Key PointAI 에이전트가 사용자 정보를 효과적으로 기억하고 활용하는 것이 LLM 기반 서비스의 핵심인데, 이 업데이트는 토큰 비용을 유지하면서 성능을 30% 이상 끌어올렸기 때문에 생산 환경 배포를 고민하는 팀이 참고할 만하다.
핵심 요약
- Mem0는 AI 에이전트와 애플리케이션을 위한 지속적인 메모리 계층을 제공하는 오픈소스 프로젝트로, 사용자 선호도와 세션·에이전트 상태를 학습해 개인화된 상호작용을 가능하게 한다.
- 2026년 4월 업데이트된 새로운 메모리 알고리즘은 LoCoMo에서 71.4점에서 92.5점으로, LongMemEval에서 67.8점에서 94.4점으로 성능을 향상시켰다.
- 단일 LLM 호출로 동작하는 ADD-only 추출 방식을 도입해 메모리를 누적시키면서도 6.7~6.9K 토큰으로 낮은 레이턴시(0.88~1.09초)를 유지한다.
전체 요약 11문장 읽기 → 003▲ 100 · 댓글 15코딩 에이전트의 성능을 좌우하는 요소들코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.AI · 머신러닝 · An Empirical Study of Harness Design for Coding Agents
코딩 에이전트의 성능을 좌우하는 요소들

Key PointAI 개발자들이 코딩 에이전트를 더 효율적으로 구축하기 위한 구체적인 설계 원칙과 최적화 지점을 얻을 수 있다.
핵심 요약
- 코딩 에이전트의 성능을 결정하는 '하네스(harness)'의 구성 요소를 체계적으로 분석한 연구를 공개했다.
- 컨텍스트 관리, 액션 스페이스, 계획 수립 등 세 가지 핵심 요소를 변수로 두고 네 가지 LLM을 대상으로 176가지 설정을 평가했다.
- 컨텍스트 창이 제한될수록 컨텍스트 관리의 중요도가 높아지며, 규칙 기반 삭제 후 LLM 기반 요약이 가장 효율적인 전략임을 확인했다.
전체 요약 5문장 읽기 →