Hugging Face 논문AI · 머신러닝

코딩 에이전트를 위한 검색 기반 추론 가속화 기법 AgSpec

원제 AgSpec: Pushing the Limits of Retrieval-Based Speculative Decoding in Coding Agent Pipelines

추천 11댓글 2Sumin Lee, Sukmin Cho, Suengjae Lim 외
Key Point

코딩 에이전트의 생성 속도를 배치당 4배 이상 높이면서도 다양한 환경에서 작동하는 기법이 나왔으며, 에이전트 파이프라인의 재사용 텍스트를 효과적으로 활용하는 새로운 접근법을 제시한다.

핵심 요약

  • 검색 기반 추론 가속화(retrieval-based speculative decoding)는 기존 텍스트에서 연속되는 부분을 복사해 토큰을 생성하는 방식으로, 코드·로그·이전 시도를 반복해서 생성하는 코딩 에이전트에 적합하다.
  • 기존 방식의 한계는 재사용 가능한 텍스트가 말뭉치에 없거나 에이전트가 출력하는 형식과 다르게 저장되며, 초안 길이가 에이전트마다 또는 턴마다 변하는 점을 고려하지 못한다.
  • AgSpec 프레임워크는 기존 검색 엔진이 제공하지 못하는 말뭉치와 초안 길이 정책을 제공한다.
  • 세션·워크스페이스·전역 말뭉치에서 검색하며, 진행 중인 세션 궤적을 유지하고 열린 파일을 에이전트의 출력 형식으로 인덱싱한다.
  • 각 에이전트의 초안 길이를 오프라인 프로파일링으로 제한하고, 검증 피드백으로 온라인 적응한다.
  • 저장소 수준 다중 에이전트 코딩 벤치마크 두 개에서 AgSpec은 5개의 검색 기반 초안 방식과 EAGLE-3을 대부분의 설정에서 능가한다.
  • 배치 크기 1에서는 자동회귀 디코딩 대비 처리량이 최대 4.37배, 배치 크기 16에서는 4.76배 증가했다.
  • 저장소 없는 벤치마크나 다중 에이전트 파이프라인 없는 벤치마크에서도 효과가 있어, 코딩 에이전트 전반에 대한 성능 향상이 일반화된다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗