생성형 AI, 반복 편집할수록 의미 왜곡되는 현상 분석

Key Point
LLM 에이전트 루프와 재귀 처리의 근본적 한계를 보여주는 사례로, 모델이 자신의 출력에 반복 접근할 때 어떻게 의미가 누적 변형되는지 이해하는 데 중요하다.
핵심 요약
- 보안 연구자가 LLM을 반복적으로 재작성하도록 지시했을 때 어떻게 실패하는지 실험했다.
- 이미지 파이프라인은 노이즈 때문에 몇 번 반복하면 즉시 왜곡되지만, 텍스트는 초기엔 안정적이다.
- 텍스트 재작성은 처음엔 세밀한 변경이 가능하지만, 오픈엔디드 프롬프트는 모델이 표류하다 안정화된다.
- 레이먼드 챈들러의 문장을 20번 이상 재작성하도록 반복하자 원문의 뉘앙스가 왜곡되고 극적 표현으로 변질됐다.
- 초반 8회차엔 '무기화된 거울', '파멸을 위해 조각된' 다리 같은 이상한 은유가 나타났고, 16회차엔 완전히 다른 의미의 공격적 이미지가 됐다.
- 약 31회 반복 후 모델이 안정화되면서 원문과는 완전히 다른 '악의적 여성' 캐릭터로 재창조됐다.