복합 질의를 위한 문서 집합 재순위화, 적응형 튜터링으로 개선
원제 AdaTutoRank: Learning to Rerank Document Sets via Adaptive Tutoring Optimization for RAG and Deep Research
추천 16댓글 1
Key Point
복잡한 정보 검색에서 단순한 관련성 매칭을 넘어 보완적이고 비중복적인 문서 집합을 구성해야 한다는 새로운 접근이 RAG 성능 개선에 직결된다.
핵심 요약
- RAG와 깊이 있는 연구에서 문서 재순위화는 하류 모델이 받는 증거를 결정하는데, 기존 재순위화기는 관련성 매칭으로만 선택해 복잡한 정보 요구에 필요한 보완적·비중복 문서 집합을 구성하지 못했다.
- 기존 방식은 문서 집합을 평가할 때 하나의 스칼라 점수로 모든 문서를 동등하게 보상하므로 감독 신호가 희박해, 중복 문서도 집합이 잘 나오면 보상받고 결정적 문서도 집합이 못 나오면 페널티를 받아 신용 할당이 불명확했다.
- AdaTutoRank는 적응형 튜터링 최적화(ATO) 기법으로 훈련되는 집합 단위 재순위화기로, 9개 평가 기준을 3단계 계층 구조로 조직해 콜드 스타트용 은레이블·강화학습용 보상·증류용 힌트를 제공한다.
- ATO는 정책의 고정된 스냅샷에서 3가지 형태의 힌트를 추출하는데: 평가 기준만, 자체 선택기가 기준 하에서 고른 형제 집합, 자체 반성기가 롤아웃과 형제 집합을 대조한 반성이며, 각 롤아웃이 그 품질에 맞는 형태를 받는다.
- 힌트 조건부 고정 교사와 힌트 없는 스냅샷 하에서 롤아웃을 재평가하면 힌트의 효과를 토큰 수준 이점으로 증류하고, 이는 그룹 상대 결과 이점을 보완한다.
- RAG·깊이 있는 연구·집합 단위 평가를 아우르는 10개 벤치마크에서 AdaTutoRank가 최고의 종합 성능을 달성했으면서도 검색 호출을 더 적게 발생시켰다.