AI가 과학 소프트웨어를 다루다: 146개 과제로 평가하는 벤치마크
Key Point
과학 도메인에서 AI의 실제 능력을 측정할 수 있는 첫 대규모 벤치마크로, 분자 설계·데이터 분석 등 연구 워크플로우 자동화의 가능성을 객관적으로 평가할 수 있게 한다.
핵심 요약
- 과학 소프트웨어는 분자 구조 조작, 이미지 분석 등 전문적인 인터페이스와 검증 가능한 결과물 생성을 요구하는 만큼 AI 에이전트에게 도전적인 환경이다.
- Hugging Face와 연구팀이 OSWorld-Science 벤치마크를 공개했으며, 여러 과학 분야의 소프트웨어 환경에서 12개의 비전 언어모델(VLM)을 146개의 고품질 작업으로 평가한다.
- 분자 그리기·역합성, 병리 이미지 분석, 통계 계산, 물리 시뮬레이션 등 실제 연구 워크플로우를 다루며, 전문가 제안과 인간-AI 협력설계를 통해 과제를 개발했다.