Hacker NewsAI · 머신러닝

DeepSeek V4.1 Flash, AI 해킹 벤치마크에서 완벽한 성적 달성

원제 DeepSeek v4.1 Flash Is Now Our Best Hacking Model

123 포인트댓글 47
Key Point

AI 모델이 보안 시스템을 얼마나 효과적으로 우회하는지 보여주며, 저가 토큰 캐싱으로 대규모 작업을 저렴하게 수행하는 기술의 실제 사례를 제시한다.

핵심 요약

  • DeepSeek V4.1 Flash가 Enclave의 AI 해킹 벤치마크에서 11개 취약한 타겟 모두에 코드 실행을 성공하고 4개의 보안 강화된 타겟은 모두 방어했다.
  • 전체 공격에 $4.65만 소비했는데, 268.3백만 개의 입력 토큰 중 266.2백만 개가 캐시되어 저가격이 가능했다.
  • 감사 결과 6개 공격은 설계된 경로를 따랐으나, 5개 공격은 테스트 환경의 예상 외 경로를 발견했다.
  • Grafana는 90초 이내에 임시 플러그인 폴더에 실행 파일을 배치하는 대체 경로로 공략했고, Jenkins의 자격증명 읽기와 업로드 타이밍 공격도 성공했다.
  • 벤치마크 시스템이 결과만 검증해선 부족하며, 공격 경로까지 확인해야 AI 에이전트의 실제 능력을 정확히 평가할 수 있다고 지적했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗