Hugging Face 논문AI · 머신러닝

언어모델의 성격을 자유도로 조절하는 기법 제시

원제 Persona Dosing: Calibrated Activation Steering for Graded Trait Control

추천 11댓글 2Zehao Jin, Junran Wang, Ruixuan Deng 외
Key Point

activation steering을 통한 성격 제어의 정확도 문제를 정량적으로 해결하는 실제 방법을 제시해, 대형 언어모델의 세밀한 행동 제어가 가능해진다.

핵심 요약

  • activation steering에서 개입 강도를 조절하는 계수를 설정할 수 있지만, 원하는 수준의 성격 표현을 얻으려면 행동 척도가 필요하다는 문제를 다룬다.
  • PersonaDose는 특정 성격 설명과 요청한 평균 강도를 통해 언어모델을 제어하는 방식을 제시한다.
  • 공유 controller를 성격 응답에 맞춰 특화한 후, 측정된 특성 표현에 대해 흐름 시간을 보정하는 두 단계로 작동한다.
  • 학습 데이터는 요청된 목표 강도와 짝을 이루지 않는다.
  • Llama-3.1-8B, Qwen3-8B, Gemma-3-4B에서 PersonaDose는 기존 contrastive activation addition 대비 핵심 특성 표현을 75 기준점에서 각각 33.2점, 18.3점, 17.8점 높였다.
  • 보정된 설정은 미학습 질문에서도 표현 우위를 유지하지만, 모든 특성에 대해 일관되진 않다.
  • 7개 학습된 특성에 걸쳐 보정된 요청은 모델당 28개 중 14-22개의 도달 가능한 목표에 대해 평균 4.7-6.2점의 타겟팅 오류를 기록한다.
  • 이는 controller가 학습한 행동 범위와 그 범위 내 요청의 정확도를 구분한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗