보상 모델의 편향을 동적으로 교정하는 BiasReducer 공개
Key Point
LLM 학습을 안내하는 보상 모델의 숨겨진 편향을 재학습 없이 교정할 수 있는 방법이 나왔으므로, 보상 모델 기반 LLM 최적화의 신뢰성을 높일 수 있다.
핵심 요약
- LLM의 보상 모델은 길이나 자신감 같은 피상적 특성에 편향되어 정확하지 않지만 점수가 높은 응답을 만드는 문제가 있다.
- 기존 편향 완화 방식은 모델 재학습이 필요하거나 알려진 편향 하나에만 고정된 교정을 적용하는 한계가 있다.
- BiasReducer는 보상 모델의 선형 헤드만 편집하고 각 데이터셋마다 맞춤형 편향 교정을 선택하는 경량 프레임워크다.