AI가 미지의 세계에서 진정한 발견을 할 수 있나
Key Point
사전학습 데이터에서의 재호출이 아닌 진정한 탐색과 발견을 측정하는 벤치마크가 처음 제시되었으며, 현재 AI 시스템의 탐색 능력에 명확한 한계가 있음을 보여준다.
핵심 요약
- 과학적 발견은 미지의 영역에서 가설 수립·실험 설계·결과 반복이라는 탐색 능력을 요구하지만, 이를 평가하기는 어렵다.
- 평가의 난제는 두 가지다: (1) 새로운 가설이 정말 참인지 검증하는 법, (2) 시스템이 진정한 탐색으로 발견했는지 학습 데이터에서 재호출한 건 아닌지 구별하는 법이다.
- 연구팀은 이 문제를 풀기 위해 ExplorationBench를 제시했으며, 실행 가능한 규칙을 가진 '외계 세계'를 기반으로 구축했다.