Skip to main content
QUICK REVIEW

[논문 리뷰] Demystifying RCE Vulnerabilities in LLM-Integrated Apps

Tong Liu, Zizhuang Deng|arXiv (Cornell University)|2023. 09. 06.
Web Application Security Vulnerabilities인용 수 5
한 줄 요약

이 논문은 LLM 통합 프레임워크 및 애플리케이션에서 원격 코드 실행(RCE) 취약성을 탐지하고 악용하기 위해 정적 분석과 프롬프트 기반 테스팅을 조합한 이중 방법 프레임워크인 LLMSmith를 제안한다. 이는 6개의 프레임워크에서 13개의 취약성을 발견했으며, 이 중 7개는 CVE ID를 할당받았고, 실제 17개의 애플리케이션을 해킹하여 광범위한 RCE 위험을 입증하고 개발자들을 위한 대응 전략을 제안한다.

ABSTRACT

LLMs show promise in transforming software development, with a growing interest in integrating them into more intelligent apps. Frameworks like LangChain aid LLM-integrated app development, offering code execution utility/APIs for custom actions. However, these capabilities theoretically introduce Remote Code Execution (RCE) vulnerabilities, enabling remote code execution through prompt injections. No prior research systematically investigates these frameworks' RCE vulnerabilities or their impact on applications and exploitation consequences. Therefore, there is a huge research gap in this field. In this study, we propose LLMSmith to detect, validate and exploit the RCE vulnerabilities in LLM-integrated frameworks and apps. To achieve this goal, we develop two novel techniques, including 1) a lightweight static analysis to examine LLM integration mechanisms, and construct call chains to identify RCE vulnerabilities in frameworks; 2) a systematical prompt-based exploitation method to verify and exploit the found vulnerabilities in LLM-integrated apps. This technique involves various strategies to control LLM outputs, trigger RCE vulnerabilities and launch subsequent attacks. Our research has uncovered a total of 20 vulnerabilities in 11 LLM-integrated frameworks, comprising 19 RCE vulnerabilities and 1 arbitrary file read/write vulnerability. Of these, 17 have been confirmed by the framework developers, with 11 vulnerabilities being assigned CVE IDs. For the 51 apps potentially affected by RCE, we successfully executed attacks on 17 apps, 16 of which are vulnerable to RCE and 1 to SQL injection. Furthermore, we conduct a comprehensive analysis of these vulnerabilities and construct practical attacks to demonstrate the hazards in reality. Last, we propose several mitigation measures for both framework and app developers to counteract such attacks.

연구 동기 및 목표

  • LLM 통합 프레임워크 및 애플리케이션에서 발생하는 RCE 취약성에 대해 체계적으로 조사하는 것. 이는 그들의 임계적인 보안 영향에도 불구하고 여전히 연구가 부족한 분야이다.
  • 프레임워크 소스 코드와 실제 LLM 통합 애플리케이션 양쪽에서 RCE 취약성을 스케일링 가능한 자동화된 방법으로 탐지하는 것.
  • 프롬프트 인젝션을 통한 실제 악용 가능성과 사용자 보안에 미치는 광범위한 영향을 평가하는 것.
  • 개발자들이 이러한 공격에 대비해 보다 강력한 보안 체계를 마련할 수 있도록 실질적인 대응 전략을 제공하는 것.

제안 방법

  • LLMSmith는 사용자 인터페이스 API에서 위험한 함수로 이어지는 콜 체인을 정적 분석을 통해 추출하고 검증함으로써 잠재적 RCE 벡터를 식별한다.
  • 백본 코드 검색 기반의 화이트박스 방법을 사용해 후보 프레임워크를 식별하고, 블랙박스 기반의 키워드 검색 방법을 통해 실제 LLM 통합 애플리케이션을 탐색하여 테스트 대상으로 선정한다.
  • 자동화된 프롬프트 기반 악용 엔진이 악성 프롬프트를 생성하여 RCE 및 잭킹(jailbreaking)을 테스트하고, 애플리케이션의 반응을 분석하여 취약성 여부를 확인한다.
  • LLM 기반 출력을 통한 신뢰할 수 없는 코드 실행 여부를 체계적으로 탐지하기 위해 자연어 처리(NLP) 기법과 기존의 잭킹 패tern을 통합한다.
  • RCE 발생 후에는 악용 확장 기법을 적용하여, 사용자 응답 가로채기 및 API 키 유출과 같은 횡방향 영향을 입증한다.
  • LLMSmith는 파이썬으로 구현되었으며, 콜 체인 추출 정확도와 성능 면에서 기존 도구인 PyCG를 능가한다.

실험 결과

연구 질문

  • RQ1LLM 통합 프레임워크에서 RCE 취약성의 근본 원인과 공통 패턴은 무엇인가?
  • RQ2정적 분석을 활용해 LLM 통합 프레임워크에서 RCE 취약성을 체계적으로 스케일링하여 탐지할 수 있는 방법은 무엇인가?
  • RQ3프롬프트 인젝션을 통해 실제 LLM 통합 애플리케이션에서 RCE 취약성이 얼마나 실제 악용 가능성이 있는가?
  • RQ4RCE 악용의 광범위한 보안 영향, 특히 다른 사용자에게까지 영향이 확산되는 정도는 어떠한가?
  • RQ5LLM 통합 시스템의 RCE 위험을 줄이기 위해 효과적인 대응 전략은 무엇인가?

주요 결과

  • LLMSmith는 6개의 LLM 통합 프레임워크에서 총 13개의 취약성을 발견했으며, 이 중 12개는 RCE, 1개는 임의의 파일 읽기/쓰기 취약성이다.
  • 13개의 프레임워크 취약성 중 11개는 개발자들에 의해 확인되었으며, 이 중 7개는 CVE ID가 할당되었고, 최대 심각도 점수는 9.8이다.
  • 테스트한 51개의 실제 LLM 통합 애플리케이션 중 17개가 취약한 것으로 밝혀졌으며, 이 중 16개는 RCE, 1개는 SQL 인젝션 취약성이다.
  • 이 프레임워크는 RCE 후 악용 시 사용자 응답 가로채기 및 API 키 유출을 통해 다른 사용자에게까지 영향을 미칠 수 있음을 입증하여 공격 영향을 크게 확장함을 보였다.
  • 개발자 반응은 엇갈렸다: 5명의 프레임워크 유지보수자 중 4명은 1~2일 내로 응답했지만, 많은 이들이 새로운 기능 개발을 취약성 수정보다 우선시하여 보안 무시 경향이 드러났다.
  • 본 연구는 현재 LLM 통합 애플리케이션 생태계가 신뢰할 수 없는 코드 실행과 예측 불가능한 LLM 동작으로 인해 체계적인 보안 격차를 겪고 있음을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.