에이전트가 여러 능력을 동시에 배우면서도 과거 기술을 잃지 않는 법
원제 ACLArena: Agent Continue Learning in Multi-stage Post-training
추천 12댓글 2
Key Point
에이전트 AI가 실제 운영 환경에서 여러 작업을 동시에 학습할 때, 기존 능력을 잃지 않으면서 효율적으로 능력을 확장하는 방법의 실증적 기준을 제시한다.
핵심 요약
- 산업 배포용 에이전트는 학습의 여러 단계에서 다양한 능력을 습득해야 하는데, 에이전트 지속학습(ACL)의 표준 방법이 없는 상황이다.
- ACLArena 프레임워크는 모델 수준과 토큰 수준에서 망각과 일반화 메커니즘을 분석하고, 다중 교사 온폴리시 증류, 자기 증류 미세조정, 모델 병합 세 가지 방식을 비교 평가했다.
- 기존 능력을 유지하면서 새 능력 습득 시 여러 능력 간 이동 방식을 파악했다.
- 고품질 궤적의 오프라인 재생과 RL로 전문화된 다중 LoRA 전문가 네트워크를 결합한 새로운 ACL 방식을 제안했다.
- 추론 및 에이전트 작업 4개 데이터셋에서 도메인 내·외 설정 모두 평가해 효과를 입증했다.