LLM 과학 코딩 에이전트를 위한 실행 가능한 검증 도구 개발
원제 Rules to Tools: Executable Checks for LLM Agents in Scientific Computing
추천 10댓글 2
Key Point
LLM 에이전트가 과학 코딩 작업에서 검증 도구의 성능이 텍스트 설명과 비교해 작업 유형에 따라 크게 달라지는데, 이는 에이전트 시스템 설계 시 검증 방식 선택의 중요성을 보여준다.
핵심 요약
- 과학 코딩 에이전트가 작성된 규칙을 실행 가능한 검증 도구로 변환하는 'Rules to Tools(R2T)' 방식을 제시한다.
- SciCode 벤치마크의 수리 작업에서 검증 도구를 사용한 그룹이 텍스트 설명만 받은 그룹과 비교해 다양한 성능을 보였다.
- 8개 작업 기준으로 도구 사용 그룹은 16개 중 15개 성공, 텍스트 그룹은 13개 성공했으며 95% 신뢰 구간은 [-12.5, 43.75]%다.
- 더 큰 24개 작업 SciCode 코호트에서는 두 그룹 모두 24개 중 13개씩 동일한 성공률을 기록했다.
- 다른 시작 프로그램을 사용한 5개 작업에서는 도구 그룹이 10개 중 7개, 텍스트 그룹이 10개 중 3개 성공했다.
- 편미분 방정식 비교에서 텍스트는 24개 중 23개 성공, 도구는 24개 모두 성공하면서 에이전트 출력이 31.2% 감소했다.
- 도구 사용으로 에이전트 측 출력 감소량은 코호트마다 다르지만, 두 코호트 모두에서 공개 CPU 사용량은 증가했다.
- 연구는 작업별 수리 결과와 준비된 검증 도구를 사용할 때 에이전트 비용의 변화를 측정했다.