Hugging Face 논문AI · 머신러닝

LLM 에이전트의 숨은 세계 모델을 끌어내는 훈련법

원제 EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making

추천 67댓글 3Yuhan Guo, Jinming Liu, Liang Xu 외
Key Point

LLM 에이전트가 새로운 환경에 적응하지 못하는 근본 원인을 진단하고, 추가 훈련 없이 기존 지식을 활용하는 훈련 기법을 제안하는 것이 개발자들의 실제 배포 문제를 해결하기 때문입니다.

핵심 요약

  • LLM 기반 에이전트는 다중 단계 의사결정에 점점 더 활용되지만 미지의 환경으로의 전이가 좋지 않다.
  • 기존 세계 모델 학습 방식은 미래 관찰을 예측하도록 훈련하지만 추가 학습 비용이 들고 예측 오류가 누적된다.
  • 디지털 환경에서 작동하는 LLM 에이전트는 사전 훈련 과정에서 이미 상당한 세계 지식을 내재화하고 있어, 새로 습득하기보다 끌어내는 것이 핵심이다.
  • 기존 감독 학습은 단일 목표 하에서만 훈련되므로 정책이 표면적 맥락 습관에 의존하게 되어 세계 모델 활용을 유도하지 못한다.
  • EVOKE는 고정된 환경 상태에서 다양한 목표를 제시하여 같은 행동 선택지를 다른 목표 하에 순위 매기도록 강제하는 사후 훈련 방법이다.
  • 이를 통해 정책은 맥락 습관이나 단일 목표 상관관계로는 순서를 정할 수 없어 사전 훈련된 세계 지식을 활용해야 한다.
  • 다양한 목표에 걸쳐 유능한 에이전트는 반드시 세계 모델을 인코딩하고 있으며, 이는 행동 선호도에서 복구 가능하다는 이론적 근거가 있다.
  • 세 가지 LLM 백본에서 EVOKE를 평가한 결과 작업 성능, 미지 환경 일반화, 데이터 효율성이 모두 향상되었다.
  • 직접적인 의사결정 감독을 통해 내재화된 세계 지식을 끌어내 전이 가능한 행동을 유도하는 새로운 접근법을 제시한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗