LLM 거부 응답을 영구 손상 없이 우회하는 Engram 기법
Key Point
LLM의 안전장치를 영구 손상 없이 우회하는 기술이 공개됨에 따라 오픈 소스 모델의 거부 메커니즘 견고성 문제가 현실화되고 있다.
핵심 요약
- 기존 가중치 절제(weight abliteration)는 모델 가중치를 영구적으로 변경해 거부 방향을 제거하지만 비거부 작업 성능도 저하시킨다.
- 이 글은 Qwen3-4B 모델을 예로 PyTorch 포워드 훅으로 런타임 중간 잔차 스트림에 개입해 가중치는 완전히 고정한 채 거부 행동을 억제하는 동적 절제(Dynamic Abliteration) 기법을 제시한다.
- 단일 레이어 벡터 뺄셈은 다운스트림 레이어가 거부 행동을 재구성하므로 작동하지 않음을 시연했다.