LLM 과학 코딩 에이전트를 위한 실행 가능한 검증 도구 개발
Key Point
LLM 에이전트가 과학 코딩 작업에서 검증 도구의 성능이 텍스트 설명과 비교해 작업 유형에 따라 크게 달라지는데, 이는 에이전트 시스템 설계 시 검증 방식 선택의 중요성을 보여준다.
핵심 요약
- 과학 코딩 에이전트가 작성된 규칙을 실행 가능한 검증 도구로 변환하는 'Rules to Tools(R2T)' 방식을 제시한다.
- SciCode 벤치마크의 수리 작업에서 검증 도구를 사용한 그룹이 텍스트 설명만 받은 그룹과 비교해 다양한 성능을 보였다.
- 8개 작업 기준으로 도구 사용 그룹은 16개 중 15개 성공, 텍스트 그룹은 13개 성공했으며 95% 신뢰 구간은 [-12.5, 43.75]%다.