Hugging Face 논문AI · 머신러닝

LLM 백도어 공격, 가중치 직교화로 제거

원제 Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation

추천 10댓글 2Minoo Kim, Vasileios Lampos, George Drayson
Key Point

LLM 배포 단계에서 백도어 공격의 위협이 증가하는 상황에서, 기존 방어 기법의 성능 저하 문제를 해결하는 새로운 제거 방식의 등장은 생산 모델의 안전성과 신뢰성에 직접적인 영향을 미친다.

핵심 요약

  • LLM은 학습 중 백도어 공격으로 감염되어 특정 트리거 입력 시 의도하지 않은 동작을 하게 되는데, 기존 방어 기법들은 백도어를 제거하면서 동시에 정상 입력에 대한 모델 성능과 안전성을 악화시키는 문제가 있다.
  • NEEDLE은 트리거 식별 후 활성화 벡터를 통해 백도어 방향과 거부 부분공간을 추정하고, 순차적 가중치 직교화를 적용해 백도어를 억제하면서 안전성 관련 표현은 보존하는 훈련 불필요 방식의 방어 기법이다.
  • 깨끗한 참조 모델이나 원본 독성 훈련 데이터가 필요 없으며, 여러 모델 계열과 공격 유형에 걸쳐 평가되었다.
  • NEEDLE은 평가된 방어 기법 중 가장 낮은 공격 성공률(ASR)을 달성했으며, 코드 주입 공격에서는 0%, KL 다이버전스도 가장 낮았으며 모델 능력과 안전성의 변화를 최소화했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗