코딩 에이전트를 위한 검색 기반 추론 가속화 기법 AgSpec
원제 AgSpec: Pushing the Limits of Retrieval-Based Speculative Decoding in Coding Agent Pipelines
추천 11댓글 2
Key Point
코딩 에이전트의 생성 속도를 배치당 4배 이상 높이면서도 다양한 환경에서 작동하는 기법이 나왔으며, 에이전트 파이프라인의 재사용 텍스트를 효과적으로 활용하는 새로운 접근법을 제시한다.
핵심 요약
- 검색 기반 추론 가속화(retrieval-based speculative decoding)는 기존 텍스트에서 연속되는 부분을 복사해 토큰을 생성하는 방식으로, 코드·로그·이전 시도를 반복해서 생성하는 코딩 에이전트에 적합하다.
- 기존 방식의 한계는 재사용 가능한 텍스트가 말뭉치에 없거나 에이전트가 출력하는 형식과 다르게 저장되며, 초안 길이가 에이전트마다 또는 턴마다 변하는 점을 고려하지 못한다.
- AgSpec 프레임워크는 기존 검색 엔진이 제공하지 못하는 말뭉치와 초안 길이 정책을 제공한다.
- 세션·워크스페이스·전역 말뭉치에서 검색하며, 진행 중인 세션 궤적을 유지하고 열린 파일을 에이전트의 출력 형식으로 인덱싱한다.
- 각 에이전트의 초안 길이를 오프라인 프로파일링으로 제한하고, 검증 피드백으로 온라인 적응한다.
- 저장소 수준 다중 에이전트 코딩 벤치마크 두 개에서 AgSpec은 5개의 검색 기반 초안 방식과 EAGLE-3을 대부분의 설정에서 능가한다.
- 배치 크기 1에서는 자동회귀 디코딩 대비 처리량이 최대 4.37배, 배치 크기 16에서는 4.76배 증가했다.
- 저장소 없는 벤치마크나 다중 에이전트 파이프라인 없는 벤치마크에서도 효과가 있어, 코딩 에이전트 전반에 대한 성능 향상이 일반화된다.