Hugging Face 논문AI · 머신러닝

에이전트 학습 효율 높이는 'X-Tree' 알고리즘 개발

원제 X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization

추천 19댓글 2Sitao Cheng, Xunjian Yin, Zhiyuan Sun 외
Key Point

에이전트가 재사용 가능한 스킬을 가중치로 학습하면서 새로운 작업으로의 일반화 성능이 크게 향상되는 방식을 제시해, 멀티스텝 의사결정이 필요한 AI 시스템 개발에 실질적 개선을 가져온다.

핵심 요약

  • 멀티스텝 에이전트를 학습할 때 기존 방식은 모든 액션 토큰을 동등하게 취급해 반복되는 부분 절차를 놓쳤다.
  • 최근 에이전트들은 LLM이 문맥으로 작성한 스킬만 활용해 가중치에 반영되지 않아 새 상황에 일반화하지 못했다.
  • 연구팀은 X-Tree(reusable eXperience tree) 기법으로 학습 데이터에서 계층 구조를 자동으로 복원했다.
  • 텍스트 토크나이저처럼 액션 구간의 재사용성을 점수화해 자주 나타나고 성공률 높은 스킬들을 병합한다.
  • X-Tree의 각 노드는 부분 스킬로 조합된 자주 쓰이는 스킬을 포착해 효율적인 일반화를 가능하게 한다.
  • LLM 호출 없이 오프라인 강화학습, 온라인 RLVR, 자기 증류 학습 등 세 가지 설정에 X-Tree를 통합했다.
  • 오프라인 RL에서는 각 노드를 학습 사례로, 온라인 RLVR에서는 적응형 스킬 보너스로, 자기 증류에서는 특권 문맥으로 활용한다.
  • WebArena에서 4.5%, ScienceWorld에서 5.8%, WebShop에서 4.1% 성공률 향상을 달성했으며 세 가지 모델 규모에서 일관되게 개선됐다.
  • 동일한 데이터와 예산 조건에서 표준 방식을 능가했으며 분석 결과 성과는 X-Tree 구조와 세 가지 통합 방식에서 비롯됐다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗