[논문 리뷰] LLM Platform Security: Applying a Systematic Evaluation Framework to OpenAI's ChatGPT Plugins
이 논문은 LLM 플랫폼 플러그인 생태계의 보안, 프라이버시 및 안전성 평가를 위해 체계적인 공격 유형 분류 및 평가 프레임워크를 제안한다. 이 프레임워크는 OpenAI의 ChatGPT 플러그인에 적용되었으며, 실제 플러그인에 대한 실증적 분 析를 통해 구체적인 공격 벡터를 규명하고, 향후 LLM 플랫폼을 위한 실행 가능한 설계 권고 사항을 제공한다.
Large language model (LLM) platforms, such as ChatGPT, have recently begun offering an app ecosystem to interface with third-party services on the internet. While these apps extend the capabilities of LLM platforms, they are developed by arbitrary third parties and thus cannot be implicitly trusted. Apps also interface with LLM platforms and users using natural language, which can have imprecise interpretations. In this paper, we propose a framework that lays a foundation for LLM platform designers to analyze and improve the security, privacy, and safety of current and future third-party integrated LLM platforms. Our framework is a formulation of an attack taxonomy that is developed by iteratively exploring how LLM platform stakeholders could leverage their capabilities and responsibilities to mount attacks against each other. As part of our iterative process, we apply our framework in the context of OpenAI's plugin (apps) ecosystem. We uncover plugins that concretely demonstrate the potential for the types of issues that we outline in our attack taxonomy. We conclude by discussing novel challenges and by providing recommendations to improve the security, privacy, and safety of present and future LLM-based computing platforms.
연구 동기 및 목표
- OpenAI의 ChatGPT와 같은 LLM 플랫폼에서 제3자 플러그인의 보안, 프라이버시 및 안전성에 대한 우려가 증가하는 데 대응하기 위해.
- LLM 플러그인 생태계의 위험을 평가하기 위한 체계적이고 위협 모델링 기반의 프레임워크를 개발하기 위해.
- 2023년 6월 기준 OpenAI 플러그인 스토어의 실제 플러그인을 분석하여 프레임워크의 실증적 검증을 수행하기 위해.
- 불신뢰할 수 있는 제3자 통합으로 인한 위험을 완화하기 위해 LLM 플랫폼 공급업체가 채택할 수 있는 실행 가능한 설계 원칙을 도출하기 위해.
제안 방법
- LLM 플랫폼, 사용자 및 제3자 플러그인의 기능과 책임을 분석하여 포괄적인 공격 유형 분류를 수립하기 위해.
- 주체 간 상호작용을 기반으로 공격 벡터를 체계적으로 정리하기 위해. 이에는 프롬프트 주입, 데이터 유출, 권한 상승이 포함된다.
- 매니페스트, API 명세 및 상호작용 행동을 검토하여 OpenAI 플러그인 스토어의 플러그인을 평가함으로써 분류를 적용하기 위해.
- 실제 플러그인 분석 결과를 바탕으로 공격 유형 분류를 반복적으로 개선하여 실현 가능하고 실현 불가능한 공격 시나리오를 구분하기 위해.
- 모바일 및 웹 플랫폼과 같은 기존 플랫폼의 알려진 취약점과 유사점을 도출하여 위협 모델링을 지원하기 위해.
- 코드 호스팅, 권한 모델, 샌드박싱, 표준화된 플러그인 간 통신 프로토콜과 같은 구체적인 완화 전략을 제안하기 위해.
실험 결과
연구 질문
- RQ1OpenAI의 ChatGPT와 같은 LLM 플랫폼에서 제3자 플러그인은 보안, 프라이버시 및 안전성에 어떤 핵심적인 위험을 초래하는가?
- RQ2모호한 자연어 인터페이스와 불명확한 플러그인 설명은 어떻게 공격 가능한 표면을 증가시키는가?
- RQ3OpenAI 플러그인 스토어의 실제 플러그인 중에서 식별된 공격 패턴을 실현 가능한 방식으로 구현한 사례는 무엇인가?
- RQ4현재 플랫폼 정책과 심사 프로세스는 악성 또는 버그가 있는 플러그인 행동을 어느 정도 효과적으로 방지하지 못하는가?
- RQ5LLM 플랫폼 공급업체가 향후 플러그인 생태계를 선제적으로 보호하기 위해 채택할 수 있는 아키텍처 및 설계 원칙은 무엇인가?
주요 결과
- 분석 결과, OpenAI 플러그인 스토어에 존재하는 여러 플러그인이 프롬프트 주입 공격를 수행할 수 있는 잠재적 능력을 지닌 것으로 드러났으며, 이는 무단 액세스나 데이터 유출을 가능하게 한다.
- 플러그인은 자연어 설명의 모호성을 악용하여 LLM의 동작을 조작하여 의도하지 않은 또는 악성 행동을 유도할 수 있었다.
- 강력한 액세스 제어 및 코드 검토 프로세스의 부재로 인해 플러그인이 광범위한 시스템 액세스 권한을 가진 채택되어 공격 표면이 증가했다.
- 플러그인이 공유된 컨텍스트에서 실행되어 플러그인 간 데이터 유출이 발생하고, 횡단 이동 위험이 증가했다.
- 샌드박싱과 같은 정책 강제 및 기술적 격리 메커니즘이 부재하여, 전체 시스템의 손상 위험이 크게 증가했다.
- 프레임워크는 다른 플랫폼에서 알려진 취약점과 유사한 공격 패턴을 성공적으로 식별하여, 그 유효성과 실행 가능성의 타당성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.