단백질 폴딩으로 AI의 추론 능력을 키운다
원제 Does Learning Protein Folding Generalize to Broader Reasoning?
추천 80댓글 2
Key Point
구조화된 과학 문제의 학습이 언어 모델의 추론 능력 개선으로 직결되는 메커니즘을 처음 실증함으로써, 사전학습 데이터 구성 방식에 대한 새로운 접근 방향을 제시한다.
핵심 요약
- 대규모 언어 모델은 표면적인 답변을 담은 인간 텍스트에 의존하면서, 그 뒤의 공간적·구조적 논리를 놓친다.
- 연구팀은 단백질 폴딩 문제에 주목했다. 하나의 단백질 구조가 수천 개의 정확히 검증 가능한 공간·위상학적 문장을 만들어내기 때문이다.
- FoldingCorpus라는 단백질 기반 질의응답 데이터세트와 Fold2Reason이라는 학습 방법을 개발했다.
- Fold2Reason은 두 신호로 학습한다: 모델의 기존 언어 헤드로 예측한 이산적 구조 답변과, 같은 표현에서 복호화한 연속적 3D 기하학이다.
- FoldBench 벤치마크에서 Fold2Reason은 Qwen3.5-9B 대비 구조 예측 점수 2.7~3.5배를 달성했다.
- 공간, 그래프, 과학, 일반 추론을 포함한 10개 벤치마크 전부에서 성능이 향상되었고, 매크로 평균 정확도가 45.09%에서 48.33%로 올랐다(+3.23 포인트).
- 비교 실험으로 무작위, 합성, 섞인 구조를 사용한 대조군은 훨씬 작거나 음수 개선만 보였다.
- 연구 결과는 비언어적이고 구조가 밀집한 과학 데이터가 언어 모델의 광범위한 추론 능력을 체계적으로 향상시킬 수 있음을 보여준다.