Hugging Face 논문AI · 머신러닝

터미널 에이전트의 명령 실행 신뢰도를 높이는 Mid-Harness 기법

원제 Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

추천 105댓글 5Minki Kang, Ryo Hachiuma, Shaokun Zhang 외
Key Point

터미널 에이전트는 프롬프트 길이나 궤적 증가보다 명령 검증에 계산을 투입하는 것이 더 효율적이라는 발견이 실제 배포 에이전트의 신뢰도 개선 전략을 바꿀 수 있다.

핵심 요약

  • 터미널 에이전트는 모델이 생성한 명령을 직접 실행하는데, 생성 능력이 있어도 실행 신뢰도가 낮으면 환경을 악화시킬 수 있는 문제가 있다.
  • Mid-Harness는 모델과 실행 환경 사이에서 여러 개의 후보 명령을 샘플링하고 검증한 뒤 가장 좋은 것만 실행하는 방식을 제안한다.
  • TMAX-9B 생성기에서는 단순 검증으로는 샘플링 이득이 적지만, 성능 높은 검증기는 같은 생성기에서도 유용한 대안을 찾을 수 있다.
  • TerminalBench-Lite에서 GPT-5.6 Sol 검증기는 8개 샘플링으로 Pass@1을 50%에서 68.03%로 올렸다.
  • TMAX-9B가 검증기 역할을 할 때는 쌍별 검증(pairwise verification)이 가장 효과적이며, 강한 검증기의 응답을 작은 모델에 증류하면 성능이 더 향상된다.
  • TMAX-9B 기준으로 액션 샘플링과 궤적 스케일링을 함께 사용하면 더 많은 궤적을 생성하는 것보다 낮은 토큰 비용으로 높은 성공률을 달성한다.
  • Mid-Harness는 다양한 모델, 벤치마크, 실행 환경에서 일관되게 성능을 개선하며, 테스트 시간 계산을 액션 스케일링에 할당하는 것이 효과적임을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗