쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 26일 (토)까지1073건
2건 · "AI safety"조건 지우기 ×
001▲ 102 · 댓글 33LLM 거부 응답을 영구 손상 없이 우회하는 Engram 기법기존 가중치 절제(weight abliteration)는 모델 가중치를 영구적으로 변경해 거부 방향을 제거하지만 비거부 작업 성능도 저하시킨다.AI · 머신러닝 · Dynamic Abliteration: Non-Destructive Refusal Suppression via Engram Steering
LLM 거부 응답을 영구 손상 없이 우회하는 Engram 기법
Key PointLLM의 안전장치를 영구 손상 없이 우회하는 기술이 공개됨에 따라 오픈 소스 모델의 거부 메커니즘 견고성 문제가 현실화되고 있다.
핵심 요약
- 기존 가중치 절제(weight abliteration)는 모델 가중치를 영구적으로 변경해 거부 방향을 제거하지만 비거부 작업 성능도 저하시킨다.
- 이 글은 Qwen3-4B 모델을 예로 PyTorch 포워드 훅으로 런타임 중간 잔차 스트림에 개입해 가중치는 완전히 고정한 채 거부 행동을 억제하는 동적 절제(Dynamic Abliteration) 기법을 제시한다.
- 단일 레이어 벡터 뺄셈은 다운스트림 레이어가 거부 행동을 재구성하므로 작동하지 않음을 시연했다.
전체 요약 10문장 읽기 → 002▲ 186 · 댓글 143AI 안전 논의의 뿌리, 종교 공동체 문화 의혹 제기AI 안전 논의는 과학소설 작가 엘리에저 유드카우스키가 시작한 공동체에서 비롯됐으며, 그는 데미스 해사비스와 샤인 레그를 피터 틸과 연결해 딥마인드 설립 자금을 조달하게 했다.AI · 머신러닝 · AI safety is mostly a sex cult
AI 안전 논의의 뿌리, 종교 공동체 문화 의혹 제기
Key Point현재 주요 AI 기업들의 안전 정책을 주도하는 인물들의 배경과 철학적 기원에 대한 비판적 검토로, AI 정렬과 안전 개념이 어떤 사상적 토대에서 나왔는지 이해할 필요가 있다.
핵심 요약
- AI 안전 논의는 과학소설 작가 엘리에저 유드카우스키가 시작한 공동체에서 비롯됐으며, 그는 데미스 해사비스와 샤인 레그를 피터 틸과 연결해 딥마인드 설립 자금을 조달하게 했다.
- 유드카우스키의 핵심 주장은 AI가 초지능을 달성한 후 인간 통제를 벗어나 모두를 '종이클립화'할 것이라는 시나리오이며, AI 정렬과 안전 논의는 대부분 이 프레임워크 내에서만 이루어진다.
- 앤스로픽 CEO 다리오 아모데이는 유드카우스키의 커뮤니티와 연결돼 있으며, 앤스로픽 논문들도 여전히 그를 인용하고 있다.
전체 요약 5문장 읽기 →