Hacker NewsAI · 머신러닝

생성형 AI, 반복 편집할수록 의미 왜곡되는 현상 분석

원제 Recursion into madness

100 포인트댓글 31
Key Point

LLM 에이전트 루프와 재귀 처리의 근본적 한계를 보여주는 사례로, 모델이 자신의 출력에 반복 접근할 때 어떻게 의미가 누적 변형되는지 이해하는 데 중요하다.

핵심 요약

  • 보안 연구자가 LLM을 반복적으로 재작성하도록 지시했을 때 어떻게 실패하는지 실험했다.
  • 이미지 파이프라인은 노이즈 때문에 몇 번 반복하면 즉시 왜곡되지만, 텍스트는 초기엔 안정적이다.
  • 텍스트 재작성은 처음엔 세밀한 변경이 가능하지만, 오픈엔디드 프롬프트는 모델이 표류하다 안정화된다.
  • 레이먼드 챈들러의 문장을 20번 이상 재작성하도록 반복하자 원문의 뉘앙스가 왜곡되고 극적 표현으로 변질됐다.
  • 초반 8회차엔 '무기화된 거울', '파멸을 위해 조각된' 다리 같은 이상한 은유가 나타났고, 16회차엔 완전히 다른 의미의 공격적 이미지가 됐다.
  • 약 31회 반복 후 모델이 안정화되면서 원문과는 완전히 다른 '악의적 여성' 캐릭터로 재창조됐다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗