AI가 과학 소프트웨어를 다루다: 146개 과제로 평가하는 벤치마크
원제 OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software
추천 24댓글 1
Key Point
과학 도메인에서 AI의 실제 능력을 측정할 수 있는 첫 대규모 벤치마크로, 분자 설계·데이터 분석 등 연구 워크플로우 자동화의 가능성을 객관적으로 평가할 수 있게 한다.
핵심 요약
- 과학 소프트웨어는 분자 구조 조작, 이미지 분석 등 전문적인 인터페이스와 검증 가능한 결과물 생성을 요구하는 만큼 AI 에이전트에게 도전적인 환경이다.
- Hugging Face와 연구팀이 OSWorld-Science 벤치마크를 공개했으며, 여러 과학 분야의 소프트웨어 환경에서 12개의 비전 언어모델(VLM)을 146개의 고품질 작업으로 평가한다.
- 분자 그리기·역합성, 병리 이미지 분석, 통계 계산, 물리 시뮬레이션 등 실제 연구 워크플로우를 다루며, 전문가 제안과 인간-AI 협력설계를 통해 과제를 개발했다.
- 각 과제는 분자 구조, 분할 마스크, 그래프, 수치 결과 등 생성된 결과물을 직접 검사하는 실행 기반 평가자로 채점되며, 미완성 결과에 대해서도 부분 점수를 부여한다.
- 벤치마크는 모델 어댑터, 상호작용 루프 제어, 궤적 로깅을 통합한 특수 프레임워크를 포함해 모델과 상호작용 전략의 비교를 지원한다.
- 현재 최고 성능의 VLM들도 강력한 프레임워크 지원에도 불구하고 과학 분야의 핵심 문제들을 해결하는 데 어려움을 겪는 것으로 나타났다.
- 연구팀은 다언어 지원, 추론 노력, 컨텍스트 길이 등의 요소를 분석했고, AI 에이전트 능력과 과학 워크플로우에서의 프레임워크 설계 개선 방향을 제시했다.