Hugging Face 논문AI · 머신러닝

AI가 과학 소프트웨어를 다루다: 146개 과제로 평가하는 벤치마크

원제 OSWorld-Science: A Benchmark of Computer Use Agents for Learning and Using Scientific Software

추천 24댓글 1Dingyuan Dai, Heli Qi, Lei Liu 외
Key Point

과학 도메인에서 AI의 실제 능력을 측정할 수 있는 첫 대규모 벤치마크로, 분자 설계·데이터 분석 등 연구 워크플로우 자동화의 가능성을 객관적으로 평가할 수 있게 한다.

핵심 요약

  • 과학 소프트웨어는 분자 구조 조작, 이미지 분석 등 전문적인 인터페이스와 검증 가능한 결과물 생성을 요구하는 만큼 AI 에이전트에게 도전적인 환경이다.
  • Hugging Face와 연구팀이 OSWorld-Science 벤치마크를 공개했으며, 여러 과학 분야의 소프트웨어 환경에서 12개의 비전 언어모델(VLM)을 146개의 고품질 작업으로 평가한다.
  • 분자 그리기·역합성, 병리 이미지 분석, 통계 계산, 물리 시뮬레이션 등 실제 연구 워크플로우를 다루며, 전문가 제안과 인간-AI 협력설계를 통해 과제를 개발했다.
  • 각 과제는 분자 구조, 분할 마스크, 그래프, 수치 결과 등 생성된 결과물을 직접 검사하는 실행 기반 평가자로 채점되며, 미완성 결과에 대해서도 부분 점수를 부여한다.
  • 벤치마크는 모델 어댑터, 상호작용 루프 제어, 궤적 로깅을 통합한 특수 프레임워크를 포함해 모델과 상호작용 전략의 비교를 지원한다.
  • 현재 최고 성능의 VLM들도 강력한 프레임워크 지원에도 불구하고 과학 분야의 핵심 문제들을 해결하는 데 어려움을 겪는 것으로 나타났다.
  • 연구팀은 다언어 지원, 추론 노력, 컨텍스트 길이 등의 요소를 분석했고, AI 에이전트 능력과 과학 워크플로우에서의 프레임워크 설계 개선 방향을 제시했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗