엔지니어링 소프트웨어 자동화, AI 에이전트 성능 평가 벤치마크 공개
원제 EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?
추천 26댓글 1
Key Point
현재 최고 성능의 AI 에이전트도 전문 엔지니어링 작업에서 극히 낮은 성공률을 보이고 있으며, 이 벤치마크는 산업용 소프트웨어 자동화 기술의 진정한 수준을 최초로 객관적으로 측정한다.
핵심 요약
- 자율 AI 에이전트가 일반 컴퓨터 작업에서 진전을 이뤘으나, 기하학적·물리적 제약을 고려한 전문 엔지니어링 자동화는 아직 미흡한 상태다.
- 연구팀이 엔지니어링 워크플로우 전체를 평가하는 '엔지월드' 벤치마크를 공개했으며, CAD·CAE·CAM·BIM·EDA·3D 시각화 등 6개 도메인의 26개 전문 소프트웨어 플랫폼을 포함한다.
- 1,301개의 전문가 큐레이션 작업을 포함하고 GUI와 CLI 인터페이스를 모두 지원하며, 소프트웨어 선택부터 열린 형태의 과제까지 6가지 유형을 다룬다.
- 최종 산출물뿐 아니라 중간 결과물의 기하학적 타당성·물리적 가능성·규칙 준수 여부를 프로그래매틱으로 검증하고, 정량 설계 과제는 이진 성공 판정 대신 명세 달성도로 연속 점수화하는 평가 방식을 도입했다.
- 7개 최신 대형 언어모델을 평가한 결과 최강 모델의 엔지스코어는 44.3에 불과했고, 다중 소프트웨어 작업 성공률은 3.6%에 그쳤다.
- 엔지월드는 전문 엔지니어링 소프트웨어를 처음부터 끝까지 다루는 에이전트 개발 진척을 측정할 수 있는 첫 공식 기반을 제공한다.