AI 생성 논문의 "과학적 결함" 탐지하고 개선하는 벤치마크
Key Point
학위 논문 등에서 AI 생성 논문 채용이 늘면서, 개별 문장의 그럴듯함으로 위장한 과학적 추론의 결함을 탐지하고 교정하는 방법이 학계와 편집자에게 실질적으로 필요해지는 상황이다.
핵심 요약
- AI가 생성한 과학 논문의 문제(슬롭)는 개별 문장은 그럴듯하지만 과학적 추론의 연결이 무너지는 특수한 형태로 나타나며, 기존 토큰 기반 AI 탐지기로는 쉽게 포착되지 않는다.
- 연구팀은 구조·논리·근거 6가지 지표로 AI 논문의 과학적 결함을 평가하는 SciSlopBench를 구축했으며, 컴퓨터과학 중심의 AI 생성 논문 390편과 연구 문제·기여도가 일치하는 인간 작성 논문 390편을 쌍으로 구성했다.
- 개발한 6가지 지표는 논문 쌍에서 AI 논문을 85.9% 정확도로 식별했으며, 기존 최고 도구인 Binoculars의 68.7%보다 크게 우월하다.