토큰 단위 수정으로 LLM 학습 데이터 만드는 onPanda
Key Point
LLM 기반 시스템의 학습 데이터 효율이 개선되면서 모델 정렬에 소요되는 비용이 대폭 줄어들 가능성이 생겼습니다.
핵심 요약
- onPanda는 대형언어모델의 정렬 데이터와 에이전트 궤적을 효율적으로 주석하는 대화형 도구다.
- 모델 응답을 읽으면서 부적절한 첫 토큰을 찾아 후보 토큰에서 대체하거나 자유로운 편집으로 수정한 후, 수정된 지점부터 계속 생성하는 방식으로 작동한다.
- 수동 후편집 대비 주석 작업 시간을 중앙값 기준 52% 단축하고, 최종 응답의 대부분이 모델 자체에서 생성되어 온-정책 학습 데이터로 적합하다.
- 토큰 단위 수정 기록은 정확한 위치와 함께 명확한 감독을 제공하며 긍정·부정 샘플이 자연스럽게 쌍을 이룬다.
- 외부 도구와 연결되어 실제 환경에서 대화형 궤적 주석이 가능하며, 논문은 Panda-CVL 데이터셋과 벤치마크를 공개한다.