논문 검색 벤치마크 ScholarCatalyst 공개
원제 ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
추천 10댓글 2
Key Point
현재의 LLM과 에이전트 기술도 논문 검색에서 전문가 수준의 성능을 내지 못하고 있으며, 이는 과학 AI 모델 개발의 새로운 과제를 드러낸다.
핵심 요약
- Hugging Face에서 논문 검색 벤치마크 ScholarCatalyst를 발표했다. 과학자들이 새로운 연구를 할 때 어떤 선행 논문을 참고하는지 연구하기 위해 만들어졌다.
- 컴퓨터과학 분야 최근 논문 207편의 제1저자 184명이 자신의 프로젝트를 진행할 때 도움이 된 논문들을 직접 라벨링했으며, 각각 상세한 근거를 제공했다.
- 과제 시작 당시 공개된 논문만 사용해 주어진 연구 질문으로부터 도움이 될 만한 논문을 검색하는 태스크로 구성했다.
- 임베딩 검색은 Recall@20에서 0.48을 기록했지만, 같은 검색 도구를 사용하는 에이전트는 0.42를 기록해 에이전트 방식이 더 낮은 성능을 보였다.
- Claude Fable 5.1 기반 에이전트도 0.51 R@20에 불과해, 완성된 논문을 학습했을 가능성이 있음에도 만족스럽지 않은 결과를 냈다.
- 이는 광범위한 문헌을 검색할 때 전문가적 직관을 갖춘 모델이 필요함을 보여준다. ScholarCatalyst를 통해 초기 아이디어에서 필요한 선행 연구를 제안할 수 있는 과학 에이전트 개발을 목표로 한다.