LLM 백도어 공격, 가중치 직교화로 제거
원제 Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation
추천 10댓글 2
Key Point
LLM 배포 단계에서 백도어 공격의 위협이 증가하는 상황에서, 기존 방어 기법의 성능 저하 문제를 해결하는 새로운 제거 방식의 등장은 생산 모델의 안전성과 신뢰성에 직접적인 영향을 미친다.
핵심 요약
- LLM은 학습 중 백도어 공격으로 감염되어 특정 트리거 입력 시 의도하지 않은 동작을 하게 되는데, 기존 방어 기법들은 백도어를 제거하면서 동시에 정상 입력에 대한 모델 성능과 안전성을 악화시키는 문제가 있다.
- NEEDLE은 트리거 식별 후 활성화 벡터를 통해 백도어 방향과 거부 부분공간을 추정하고, 순차적 가중치 직교화를 적용해 백도어를 억제하면서 안전성 관련 표현은 보존하는 훈련 불필요 방식의 방어 기법이다.
- 깨끗한 참조 모델이나 원본 독성 훈련 데이터가 필요 없으며, 여러 모델 계열과 공격 유형에 걸쳐 평가되었다.
- NEEDLE은 평가된 방어 기법 중 가장 낮은 공격 성공률(ASR)을 달성했으며, 코드 주입 공격에서는 0%, KL 다이버전스도 가장 낮았으며 모델 능력과 안전성의 변화를 최소화했다.