종양 위원회 토론 기록으로 암 진료 AI 학습 데이터셋 공개
원제 OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories
추천 11댓글 2
Key Point
의료 AI가 단순 정보 제공을 넘어 복잡한 다학제 진료 의사결정에 얼마나 미흡한지 처음으로 실제 현장 데이터로 입증하는 벤치마크다.
핵심 요약
- 종양 치료 결정을 위해 여러 전문의가 함께 진료하는 '종양 위원회(tumor board)' 논의 과정을 기록한 벤치마크 'OpenTumorBoard'가 공개되었다.
- YouTube에 공개된 종양 위원회 영상 12,534분을 전사해 611명의 환자 사례와 10개 전문 역할에 걸쳐 19,157개의 토론 턴을 수집했다.
- 벤치마크는 두 가지 평가 설정을 제공한다: 실제 토론 중 제기된 임상 질문에 LLM이 답하는 'SPECIALIST TURN'과, LLM이 전체 토론을 생성하고 치료 권장안·수술 계획·임상시험 매칭에 합의하는 'BOARD SIMULATION'이다.
- 14개의 범용 및 의료 특화 LLM 평가 결과, 최고 성능 모델도 임상 동등성에서 5점 만점에 3.43점, 기록된 위원회 결론 부합도에서 2.78점으로 상당한 한계를 보였다.
- 지도 학습과 강화학습을 통한 파인튜닝은 검증 데이터셋에서 성능을 개선했으며, 이는 실제 토론 궤적이 모델 적응을 지원할 수 있음을 시사한다.
- MD 자격 전문가 3명이 벤치마크 일부를 검토한 결과 환자 사례의 높은 정보 커버리지·정확성과 추출된 합의 결론의 우수한 신뢰도를 확인했다.
- OpenTumorBoard와 자동 큐레이션 파이프라인을 공개하여 다학제 개인화 암 의사결정을 위한 LLM 개발과 평가를 지원할 예정이다.