장기 대화에서 AI가 사람을 이해하는가
원제 RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations
추천 60댓글 1
Key Point
AI가 실제 장기 대화에서 사용자를 얼마나 이해할 수 있는지 측정하는 벤치마크를 제시하며, 현재 메모리 기반 접근법의 실제 효용성과 한계를 실증 데이터로 보여준다.
핵심 요약
- AI 동반자와 수개월간 대화한 10개의 실제 관계 데이터셋 RealCompanion을 공개했다.
- 총 27,218개 메시지, 최대 120일 분량의 실제 대화 기록을 포함하며 각각 프로필, 페르소나, 채팅 라벨, 질문 세트와 함께 제공된다.
- 모든 라벨에는 대화 메시지를 단계별로 검증한 추론 과정이 담겨 있다.
- 과거 대화는 생각보다 적게 필요하며 시간이 지날수록 멀어진다: 최근 메시지 윈도우로 95.9%의 질문에 필요한 메시지를 찾을 수 있고, 실제 메모리가 필요한 질문 중 96%는 저장된 증거 없이도 답할 수 있다.
- 메모리가 필요한지 판단하는 자동 탐지 시스템은 실제 메시지에서는 작동하지 않으며, 질문을 직접 작성하면 신호를 드러내고 메모리 라벨링을 하면 메모리 사용이 10~14포인트 증가한다.
- 세 가지 에이전트 시스템 모두 페르소나를 동일한 F1 점수로 재구성했지만 비용은 31배 차이가 났다.