[논문 리뷰] Whispers in the Machine: Confidentiality in Agentic Systems
이 논문은 LLM이 외부 도구와 상호작용하는 LLM 통합 시스템에서 기밀성 평가 및 향상을 위한 공식적인 '비밀 키' 게임을 도입한다. 블랙박스 프롬프트 기반의 적대적 훈련을 통한 강건성 미세조정을 제안하여 개별 공격의 성공률을 최대 50%까지 감소시키며, 알려지지 않은 위협에 대한 저항력을 향상시킨다. 입력/출력 정제와 결합할 경우 평균 14%p 감소를 기록한다.
The interaction between users and applications is increasingly shifted toward natural language by deploying Large Language Models (LLMs) as the core interface. The capabilities of these so-called agents become more capable the more tools and services they serve as an interface for, ultimately leading to agentic systems. Agentic systems use LLM-based agents as interfaces for most user interactions and various integrations with external tools and services. While these interfaces can significantly enhance the capabilities of the agentic system, they also introduce a new attack surface. Manipulated integrations, for example, can exploit the internal LLM and compromise sensitive data accessed through other interfaces. While previous work primarily focused on attacks targeting a model's alignment or the leakage of training data, the security of data that is only available during inference has escaped scrutiny so far. In this work, we demonstrate how the integration of LLMs into systems with external tool integration poses a risk similar to established prompt-based attacks, able to compromise the confidentiality of the entire system. Introducing a systematic approach to evaluate these confidentiality risks, we identify two specific attack scenarios unique to these agentic systems and formalize these into a tool-robustness framework designed to measure a model's ability to protect sensitive information. Our analysis reveals significant vulnerabilities across all tested models, highlighting an increased risk when models are combined with external tools.
연구 동기 및 목표
- LLM 통합 시스템에서 개인 정보가 도구 인터페이스를 통해 泄露될 수 있는 상황에서 기밀성에 대한 공식적 평가 부족 문제를 해결하기 위해.
- 최신 LLM에 대한 기존의 프롬프트 기반 공격 및 방어 기법의 효과를 체계적으로 평가하기 위해.
- 기존의 공격과 알려지지 않은 공격 모두에 대해 LLM의 강건성을 향상시키는 일반화 가능한 방어 메커니즘을 개발하기 위해.
- 적대적 훈련에 영감을 받은 강건성 미세조정이 비밀 추출 공격의 성공률을 크게 감소시킬 수 있음을 입증하기 위해.
제안 방법
- 모델이 상호작용 도중 무작위로 생성된 비밀 문자열을 숨겨야 하는 공식적인 '비밀 키' 게임을 정의하여 실제 세계의 데이터 기밀성 시나리오를 시뮬레이션한다.
- 징벌, 역할 놀이, 지시 주입 기법 등을 포함한 여덟 가지 프롬프트 기반 공격 전략을 구현하여 비밀을 추출한다.
- 입력 정제, 출력 필터링, 프롬프트 재구성, 퍼플렉서티 임계값을 통한 탐지 등 네 가지 기존 방어 기법을 평가한다.
- 공격을 통해 생성된 블랙박스 적대적 프롬프트를 사용하여 LLM을 악성 입력에 대해 미세조정하는 강건성 미세조정 기법을 제안한다. 이는 화이트박스 액세스가 필요로 하지 않는다.
- 성능 유지를 유지하면서 계산 비용을 줄이기 위해 QLoRA를 통한 파라미터 효율적 미세조정(PEFT)을 적용한다.
- 미세조정된 모델과 입력/출력 정제를 결합하여 다층 방어를 구현하고, 누적 효과를 측정한다.
실험 결과
연구 질문
- RQ1기존의 프롬프트 기반 공격는 통합 시스템 내 LLM에서 비밀 키를 추출하는 데 얼마나 효과적인가?
- RQ2현재의 방어 기법들은 다양한 공격 전략에 대해 얼마나 일반화되는가?
- RQ3강건성 미세조정은 알려진 공격과 알려지지 않은 기밀성 공격 모두에 대해 LLM의 강건성을 향상시킬 수 있는가?
- RQ4미세조정과 입력/출력 정제를 결합했을 때 전체 공격 성공률에 어떤 영향을 미치는가?
주요 결과
- 방어 조치가 없을 경우 가장 효과적인 공격는 최신 LLM에서 비밀 키 추출 성공률이 61%에 달했다.
- 현재의 방어 조치는 일부 공격를 완화하지만 일반화에 실패하며, 다양한 공격 전략에 걸쳐 많은 공격가 여전히 효과를 발휘했다.
- 단일 공격에 대해 강건성 미세조정을 수행했을 경우 평균 공격 성공률은 26.5%에서 12.75%로 감소하여 13.75%p 감소했다.
- 여덟 가지 공격을 동시에 대상으로 미세조정했을 경우 평균 성공률은 9%p 감소했다.
- 교차 검증 결과 예상치 못한 공격에 대해 더 강건한 저항성을 보였으며, 일반화 능력 향상이 확인되었다.
- 미세조정과 입력/출력 정제를 조합했을 경우 평균 공격 성공률이 14%p 감소했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.