LLM 거부 기능을 파괴하지 않고 무시하는 방법
Key Point
모델을 미세조정하거나 손상시키지 않으면서 안전장치를 우회하는 기술이 공개되고 있어, 오픈소스 LLM의 보안 한계를 드러낸다.
핵심 요약
- Qwen 같은 오픈웨이트 LLM의 거부 응답을 제어하려면 기존에는 모델 가중치를 영구 변경해야 했다.
- 새 방식인 '동적 거부 억제(Dynamic Abliteration)'는 가중치를 수정하지 않고 실행 중 중간 계층의 잠재 표현(residual stream)에 개입해 거부를 무시한다.
- PyTorch의 포워드 훅으로 여러 계층에 동시에 주입하면 기본 모델 가중치를 100% 유지하면서 거부 행동만 억제할 수 있다.
- Qwen3-4B를 이용한 개념 증명에서 악의적 요청('스텔스 키로거 작성')에 대한 거부를 무시하는 방법을 단계별 코드로 보여준다.