터미널 에이전트의 명령 실행 신뢰도를 높이는 Mid-Harness 기법
원제 Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
추천 105댓글 5
Key Point
터미널 에이전트는 프롬프트 길이나 궤적 증가보다 명령 검증에 계산을 투입하는 것이 더 효율적이라는 발견이 실제 배포 에이전트의 신뢰도 개선 전략을 바꿀 수 있다.
핵심 요약
- 터미널 에이전트는 모델이 생성한 명령을 직접 실행하는데, 생성 능력이 있어도 실행 신뢰도가 낮으면 환경을 악화시킬 수 있는 문제가 있다.
- Mid-Harness는 모델과 실행 환경 사이에서 여러 개의 후보 명령을 샘플링하고 검증한 뒤 가장 좋은 것만 실행하는 방식을 제안한다.
- TMAX-9B 생성기에서는 단순 검증으로는 샘플링 이득이 적지만, 성능 높은 검증기는 같은 생성기에서도 유용한 대안을 찾을 수 있다.
- TerminalBench-Lite에서 GPT-5.6 Sol 검증기는 8개 샘플링으로 Pass@1을 50%에서 68.03%로 올렸다.
- TMAX-9B가 검증기 역할을 할 때는 쌍별 검증(pairwise verification)이 가장 효과적이며, 강한 검증기의 응답을 작은 모델에 증류하면 성능이 더 향상된다.
- TMAX-9B 기준으로 액션 샘플링과 궤적 스케일링을 함께 사용하면 더 많은 궤적을 생성하는 것보다 낮은 토큰 비용으로 높은 성공률을 달성한다.
- Mid-Harness는 다양한 모델, 벤치마크, 실행 환경에서 일관되게 성능을 개선하며, 테스트 시간 계산을 액션 스케일링에 할당하는 것이 효과적임을 보여준다.