[논문 리뷰] A Security Risk Taxonomy for Prompt-Based Interaction With Large Language Models
이 논문은 프롬프트 기반 상호작용에 초점을 맞춘 대규모 언어 모델(Large Language Models, LLMs)을 위한 종합적인 보안 위험 분류 체계를 제안한다. 공격의 대상(사용자, 모델, 제3자)과 CIA 삼각측면(기밀성, 무결성, 가용성)을 기반으로 공격를 분류한다. 실제 공격 사례를 확인하고 향후 보안 LLM 응용 프로그램 개발을 위한 체계적 프레임워크를 제공한다.
As large language models (LLMs) permeate more and more applications, an assessment of their associated security risks becomes increasingly necessary. The potential for exploitation by malicious actors, ranging from disinformation to data breaches and reputation damage, is substantial. This paper addresses a gap in current research by specifically focusing on security risks posed by LLMs within the prompt-based interaction scheme, which extends beyond the widely covered ethical and societal implications. Our work proposes a taxonomy of security risks along the user-model communication pipeline and categorizes the attacks by target and attack type alongside the commonly used confidentiality, integrity, and availability (CIA) triad. The taxonomy is reinforced with specific attack examples to showcase the real-world impact of these risks. Through this taxonomy, we aim to inform the development of robust and secure LLM applications, enhancing their safety and trustworthiness.
연구 동기 및 목표
- 윤리적 및 사회적 우려와는 별개로 체계적인 LLM 보안 위험 연구의 격차를 보완한다.
- 강력한 시스템 설계를 지원하기 위해 프롬프트 기반 LLM 상호작용의 보안 위협을 체계적으로 분류하는 분류 체계를 개발한다.
- 기밀성, 무결성, 가용성에 미치는 영향과 함께 공격 대상(사용자, 모델, 제3자)을 기반으로 공격를 분류하여 포괄적인 위험 커버리지 확보.
- 이러한 위협의 실질적 영향과 구현 가능성은 실세계 공격 사례를 통해 입증한다.
- 기존 사이버보안 모델 및 기준과 통합 가능한 미래 연구를 위한 기초 프레임워크를 제공한다.
제안 방법
- 공격 대상(사용자, LLM, 제3자)과 CIA 삼각측면(기밀성, 무결성, 가용성)을 축으로 하는 이원축 분류 체계를 제안한다.
- 공격 대상과 CIA 차원을 기반으로 프롬프트 인젝션, 데이터 유출, 모델 조작 등의 공격 유형을 구분한다.
- 실제 LLM 상호작용 사례를 활용해 각 공격 유형의 관련성과 구현 가능성 검증.
- 기존의 보편적인 사이버보안 프레임워크와 통합하여 기존 위협 모델링 관행과의 호환성 확보.
- 일般적인 시스템 수준 보안(CIA)과 당사자별 보호 필요성(사용자, 이해관계자, 제3자)을 모두 수용할 수 있도록 분류 체계를 구성.
- 모든 시연에서 악의적, 비윤리적 예시를 방지하기 위해 단지 설명용, 익명화된, 악성 요소가 없는 사례만 사용한다.

실험 결과
연구 질문
- RQ1대규모 언어 모델에서 프롬프트 기반 상호작용과 관련된 주요 보안 위험은 무엇인가?
- RQ2기밀성, 무결성, 가용성에 대한 영향과 공격 대상을 기반으로 LLM 보안 위협을 어떻게 체계적으로 분류할 수 있는가?
- RQ3이러한 보안 위험의 실현 가능성과 영향을 입증하는 실세계 공격 사례는 무엇인가?
- RQ4이 분류 체계는 더 안전하고 신뢰할 수 있는 LLM 응용 프로그램 개발을 어떻게 지원하는가?
- RQ5이 분류 체계는 기존 사이버보안 및 위험 평가 프레임워크에 어떻게 통합될 수 있는가?
주요 결과
- 제안된 분류 체계는 사용자, LLM 자체, 제3자라는 세 가지 공격 대상으로 LLM 보안 위험을 체계적으로 분류하여 타겟 기반 방어 전략 수립을 가능하게 한다.
- 프롬프트 인젝션, 데이터 유출, 모델 조작 등의 공격 유형은 금융 사기 및 정보 유출 사례를 포함해 실세계 상황에서 실현 가능하고 영향력 있는 것으로 입증되었다.
- 공격 대상과 함께 CIA 삼각측면(기밀성, 무결성, 가용성)을 통합함으로써 LLM 시스템의 위협 모델링에 대한 강력하고 확장 가능한 프레임워크를 제공한다.
- 실증 사례는 LLM이 이용약관 또는 법적 경계를 위반하지 않더라도 악성 콘텐츠 생성, 사용자 위장, 민감한 데이터 泄露 등의 방식으로 악용될 수 있음을 입증한다.
- 이 분류 체계는 향후 연구를 위한 기초 참고 자료로서, LLM 보안 분야에서 새로운 위협의 체계적 식별 및 완화를 가능하게 한다.
- 본 연구는 LLM이 새로운 공격 뿐 아니라 기존의 고전적 사이버 공격에도 취약하다는 점을 강조하며, 현재의 안전성 및 공정성 조치를 초월한 보다 강화된 보안 메커니즘의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.