Hugging Face 논문AI · 머신러닝

장시간 로봇 작업에서 기억력을 평가하는 새 벤치마크 공개

원제 EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks

추천 29댓글 1Lizhou Liang, Xinyu Zhong, Miao Pan 외
Key Point

로봇이 복잡한 장시간 작업을 수행할 때 필요한 기억 능력의 핵심 문제를 체계적으로 분석하고 평가할 구체적 벤치마크와 솔루션을 제시해 구체화 합니다.

핵심 요약

  • 로봇이 장시간 환경과 상호작용할 때 정보를 유지·갱신해야 하는데, 현재 에이전트들은 이를 제대로 못하고 있습니다.
  • 문제의 원인은 네 가지입니다: 세부 시각 정보 기억 부족, 동적 세계 상태 추적 불안정, 상호작용 결과로 드러난 정보 미기록, 과거 경험 활용 제한.
  • 이를 평가할 벤치마크가 없어 EmbodiedMemory-Bench(EMem-Bench)를 개발했습니다.
  • EMem-Bench는 4개 작업군에 걸쳐 2,554개 대화형 에피소드로 구성되며, 에이전트가 상호작용 기록으로부터 기억을 형성한 후 나중에 그것을 활용해 작업을 완료해야 합니다.
  • 새 외부 기억 시스템 Embodied-Memorizer(EMem)는 경험을 공간 기억, 사건 기억, 장면 기억 3가지로 구조화합니다.
  • 8B 파라미터 정책 모델 EMem-8B를 학습시켜 이 기억들을 관리·활용하도록 했습니다.
  • 오픈소스 및 프로프라이터리 다중모달 대규모 언어모델(MLLM), 대표 다중모달 기억 시스템들을 평가한 결과, 현존 모델들은 네 가지 과제 모두에서 불균형적이고 약한 성능을 보였습니다.
  • 같은 기반 모델에서 EMem이 평가된 기억 시스템 중 최고 성능을 달성했고, 오픈소스와 프로프라이터리 모델 모두를 개선시켰으며, EMem-8B는 기반 모델보다 더욱 개선된 결과를 냈습니다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗