과학적 설명이 실험 예측을 얼마나 개선하는지 측정하다
Key Point
과학적 설명이 AI 예측을 실제로 개선하는지를 엄밀히 측정하려는 방법론을 제시하지만, 대부분의 테스트에서 설명의 효과가 증명되지 않았다는 점이 흥미롭다.
핵심 요약
- 연구 에이전트가 계획한 실험을 설명할 때, 그 설명이 예측 정확도를 실제로 높이는지 측정하는 방법을 제시했다.
- 같은 중재·예측자·결과를 가진 쌍 예측을 비교하되 설명과 맥락을 달리하여, 약속 이행·예측 이득·신호 습득을 추적하는 5가지 검증을 수행했다.
- 통제된 학습 환경의 336개 전망 상태, 독성 테스트 12개 지표, OpenML 24개 작업을 대상으로 평가했으나 신용도 점수 결정이 결론적이지 않았다.