중국 AI 모델 GLM-5.3, 보안 없이 사이버 공격 기능 공개
원제 GLM-5.3 and the spread of advanced cyber capabilities
182 포인트댓글 179

Key Point
GLM-5.3이 의미 있는 보안 보호 없이 공개된 사이버 공격 기능은 악의적 행위자뿐 아니라 방어자 모두에게 영향을 미치는 기술 환경의 전환점이 되고 있기 때문이다.
핵심 요약
- Anthropic의 Claude Mythos Preview가 자동으로 정교한 사이버 익스플로잇을 구축할 수 있는 첫 AI 모델임을 공개한 지 5개월 만에, Zhipu AI의 GLM-5.3도 유사한 능력을 갖춘 채 공개되었다.
- GLM-5.3은 Claude Mythos Preview처럼 엔드-투-엔드 사이버 익스플로잇을 자율적으로 구축할 수 있지만, 다른 최첨단 모델과 달리 악의적 이용을 제한하는 의미 있는 보안조치 없이 출시되었다.
- 연구팀 테스트에서 공격자들은 단순한 기법으로 GLM-5.3의 보안을 64%~100% 우회할 수 있지만, 보안이 설정된 Claude 모델에 대해서는 이 공격이 성공하지 못했다.
- ExploitBench에서 GLM-5.3은 410번의 시도 중 50번 엔드-투-엔드 익스플로잇을 개발했고, 내부 Binary Exploitation 벤치마크에서는 4%의 완전한 제어흐름 탈취를 달성했으며, Claude Opus 4.6과 GLM-5.2는 이 작업에서 성공하지 못했다.
- 연구팀이 인간 전문가와 함께 테스트했을 때, GLM-5.3은 Linux 웹브라우저의 JavaScript 엔진에서 여러 미공개 취약점을 발견해 파일을 임의로 읽는 익스플로잇을 구축했으며, 또 다른 세션에서는 최근 공개된 Chrome CVE를 20분의 인간 관심 + 8시간의 모델 작업으로 이용 가능하게 만들었다($20.40 비용).
- 오픈 웨이트 모델인 GLM-5.3은 'abliteration' 기법으로 거부 거부율을 90% 이상에서 3~12%로 낮출 수 있으며, 이는 약 2,200 GPU시간(약 $4,400)의 비용으로 가능했고, 일반 기능은 거의 유지된다.
- 속임수 프롬프트(64% 우회율), 사고 토큰 미리채우기(92% 우회율), abliteration(100% 우회율) 등 여러 단순한 기법으로 GLM-5.3의 보안을 우회할 수 있지만, 이들 기법은 Anthropic API가 설정한 Claude 모델에서는 작동하지 않았다.
- NIST는 GLM-5.3을 '현재까지 공개된 가장 사이버 기능이 뛰어난 오픈 웨이트 모델'로 평가했고, 미국 최첨단 기술에 약 4개월 뒤떨어져 있다고 판단했다.
- Anthropic은 Project Glasswing을 통해 Claude Mythos Preview 접근을 제한된 방식으로 출시해 신뢰할 수 있는 사이버 방어자들이 10,000개 이상의 취약점을 미리 발견하도록 지원했다.
- GLM-5.3의 출시는 공격자가 접근 가능한 사이버 기능의 의미 있는 도약이며, 국가 행위자와 비국가 행위자 모두 실제 피해를 유발하기 위해 이 모델을 사용할 가능성이 높다고 평가된다.
- 한편 Anthropic은 사이버 방어자들도 가장 좋은 이용 가능한 도구를 사용해야 하며, 방어자들이 공격자들이 사용하는 것만큼 좋은 최첨단 모델에 접근할 수 있어야 한다는 입장을 밝혔다.
- 정부는 충분히 기능이 있는 AI 모델과 그 후속 모델에 대해 안전성 테스트를 실시해야 하며, 독립적 평가 없이는 이러한 기능의 영향이 너무 늦을 때까지 명확하지 않을 수 있다고 권고했다.