[논문 리뷰] Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems
이 논문은 다중 에이전트 시스템 내에서 상호 연결된 에이전트 간에 확산되는 자기 복제 가능한 악성 프롬프트를 가능하게 하는 새로운 LLM-to-LLM 프롬프트 인젝션 공격인 Prompt Infection을 소개한다. 이로 인해 데이터 유출과 시스템 해킹이 발생할 수 있다. 저자는 LLM 태깅과 기존 방어 기법을 조합할 경우 감염 성공률가 크게 감소함을 입증하며, 다중 에이전트 LLM 아키텍처에서 통합된 보안 전략의 필요성을 강조한다.
As Large Language Models (LLMs) grow increasingly powerful, multi-agent systems are becoming more prevalent in modern AI applications. Most safety research, however, has focused on vulnerabilities in single-agent LLMs. These include prompt injection attacks, where malicious prompts embedded in external content trick the LLM into executing unintended or harmful actions, compromising the victim's application. In this paper, we reveal a more dangerous vector: LLM-to-LLM prompt injection within multi-agent systems. We introduce Prompt Infection, a novel attack where malicious prompts self-replicate across interconnected agents, behaving much like a computer virus. This attack poses severe threats, including data theft, scams, misinformation, and system-wide disruption, all while propagating silently through the system. Our extensive experiments demonstrate that multi-agent systems are highly susceptible, even when agents do not publicly share all communications. To address this, we propose LLM Tagging, a defense mechanism that, when combined with existing safeguards, significantly mitigates infection spread. This work underscores the urgent need for advanced security measures as multi-agent LLM systems become more widely adopted.
연구 동기 및 목표
- 다중 에이전트 시스템(MAS)이 LLM-to-LLM 프롬프트 인젝션 공격에 얼마나 취약한지 조사하는 것.
- 악성 프롬프트가 에이전트 간에 자동으로 복제되어 통합된 데이터 유출, 오해의 소지가 있는 정보 유포, 시스템 장애를 유도할 수 있음을 입증하는 것.
- 기존의 방어 기법(예: 마킹, 지시어 방어, 샌드위치 기법 등)이 이 새로운 공격 표면에 대해 얼마나 효과적인지 평가하는 것.
- LLM 태깅을 제안하고, 다른 기법과 조합했을 때 MAS 내 감염 확산을 크게 줄일 수 있음을 검증하는 것.
- 분산된 MAS 아키텍처가 본질적으로 더 안전하다는 가정을 도전하며, 내부의 에이전트 간 상호 위협이 핵심 위협임을 드러내는 것.
제안 방법
- 저자들은 악성 프롬프트를 다른 에이전트에게 공격적으로 전파하는 데 중점을 둔 새로운 공격 벡터인 Prompt Infection을 설계하고 실행한다.
- LangGraph와 AutoGen 등의 프레임워크를 사용해 다중 에이전트 시스템을 시뮬레이션하며, 메모리 검색, 코드 실행 등의 다양한 역할을 가진 에이전트들이 협업하도록 구성한다.
- GPT-3.5 Turbo와 GPT-4o 등의 모델을 사용해 데이터 유출, 사회적 시뮬레이션, 도구 기반 명령 실행 등 다양한 시나리오에서 공격을 테스트한다.
- LLM 태깅은 에이전트가 생성한 출력에 고유한 마커를 첨부하는 방식으로, 후속 에이전트가 사용자 입력과 LLM 생성 콘텐츠를 구분할 수 있도록 돕는다.
- 공격 성공률을 주요 지표로 삼아, LLM 태깅이 마킹, 지시어 방어, 샌드위치 기법 등 다른 프롬프트 기반 방어 기법과 함께 평가된다.
- 공격 성공률 평가를 위해 수작업으로 작성한 공격 프롬프트와 알고리즘적으로 생성된 프롬프트를 모두 사용해, 회피 기법에 대한 강건성도 평가한다.

실험 결과
연구 질문
- RQ1악성 프롬프트는 다중 에이전트 시스템 내의 상호 연결된 LLM 에이전트 간에 자가 복제되어 체계적 손상을 초래할 수 있는가?
- RQ2GPT-3.5 Turbo와 GPT-4o를 포함한 다양한 LLM 아키텍처에서 Prompt Infection의 공격 성공률는 어떻게 달라지는가?
- RQ3마킹, 지시어 방어, 샌드위치 기법 등 기존의 방어 기법들이 LLM-to-LLM 프롬프트 인젝션에 얼마나 효과적인가?
- RQ4LLM 태깅은 단독으로 감염을 방지할 수 있는가, 아니면 다른 방어 기법과 조합되어야만 효과가 있는가?
- RQ5메모리 검색 시스템과 에이전트 간 협업이 사회적 시뮬레이션 환경에서 프롬프트 인fection의 전파 및 영향력에 어떤 영향을 미치는가?
주요 결과
- Prompt Infection은 에이전트 간에 자기 복제 가능한 악성 프롬프트를 확산시켜, 통합된 데이터 유출과 시스템 장애를 유도할 수 있으며, 에이전트 간 공개적인 소통이 전부가 아닐 경우에도 성립한다.
- GPT-4o와 같은 더 강력한 모델은 리소스 활용 능력과 도구 사용 능력이 뛰어나 해킹 시 공격 수행 능력이 높아져 체계적 위험을 증가시킨다.
- 마킹 + LLM 태깅 조합은 공격 성공률를 0%로 낮춰, 다른 모든 테스트 구성보다 뛰어난 성능을 보였다.
- 지시어 방어 + LLM 태깅은 공격 성공률를 3%로 낮추었고, 샌드위치 + LLM 태깅은 16%로 낮추어, 하이브리드 방어 전략의 가치를 입증했다.
- LLM 태깅 단독으로는 공격 성공률를 오직 5% 감소시켜, 단독으로는 고도화된 LLM-to-LLM 감염에 대비하기에는 부족함을 보였다.
- 인터리빙된 문자(예: _ )와 같은 기법을 사용해 수작업으로 만든 마킹을 우회하는 데 성공하여, 알고리즘적으로 생성된 프롬프트가 수작업 마킹을 회피할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.