GitHub TrendingAI · 머신러닝오늘의 주요

p-e-w/heretic

언어 모델 검열 자동 제거 도구 Heretic 공개

원제 p-e-w/heretic

스타 32,984당일 +233Python
Key Point

안전 필터를 우회하는 완전 자동화 도구의 등장으로, 모델 수정 기술의 접근성이 크게 낮아졌으며 이로 인한 악용 가능성 증가와 기술 민주화 사이의 균형 문제가 제기된다.

핵심 요약

  • GitHub에 공개된 Heretic은 방향성 절제(directional ablation)와 Optuna 기반 매개변수 최적화를 결합해 언어 모델의 안전 정렬을 자동으로 제거하는 Python 도구다.
  • 사용자가 명령줄 명령만으로 모델을 처리할 수 있으며, 트랜스포머 구조 이해가 필요 없다.
  • Gemma-3-12B-IT 기준으로 Heretic이 생성한 모델은 유해 프롬프트 거부율 3/100, KL 발산 0.16으로, 수동 절제 모델(KL 발산 0.45~1.04)보다 원래 성능을 더 잘 보존했다.
  • 최적화 과정에서 방향성 인덱스를 정수 대신 실수로 취급해 선형 보간을 통해 추가 방향을 탐색하고, 컴포넌트별로 별도 매개변수를 적용하는 등 기존 방식보다 유연한 설계를 적용했다.
  • RTX 3090에서 Qwen3-4B-Instruct 처리에 약 20~30분 소요되며, bitsandbytes 양자화로 VRAM 요구량을 줄일 수 있다.
  • 처리 완료 후 모델 저장, Hugging Face 업로드, 대화형 테스트, 표준 벤치마크 실행 중 선택할 수 있다.
  • Heretic 모델은 커뮤니티에서 5000개 이상 생성됐으며, 사용자들로부터 MMLU, GSM8K 등 표준 지표에서 경쟁 도구보다 우수한 성능 평가를 받았다.
  • Gemma-3, Qwen3.5 등 대부분의 밀집 모델과 다중모달, 일부 MoE 아키텍처를 지원하지만, 상태 공간 모델 같은 연구 구조는 아직 미지원이다.
  • AGPL-3.0 라이선스로 배포되며, 저장소에 의존성 버전을 고정한 uv.lock 파일을 포함해 재현성을 보장한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗