Skip to main content
QUICK REVIEW

[논문 리뷰] LeftoverLocals: Listening to LLM Responses Through Leaked GPU Local Memory

Tyler Sorensen, Heidy Khlaaf|arXiv (Cornell University)|2024. 01. 29.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 Apple, AMD, Qualcomm, Imagination GPU에서 프로세스 또는 컨테이너 경계를 초월해 GPU 로컬 메모리에 남아 있는 잔류 데이터를 활용해 원격으로 민감한 데이터—특히 LLM 응답—을 복구할 수 있는 사이드채널 취약성인 LeftoverLocals를 소개한다. 최적화된 GPU 메모리 영역에 남아 있는 잔류 데이터를 악용하여, 저자들은 AMD Radeon RX 7900 XT에서 쿼리당 최대 181MB의 정밀도 높은 LLM 출력을 복원하는 개념 증명 공격을 구현했다.

ABSTRACT

This paper describes LeftoverLocals: a vulnerability that allows data recovery from GPU memory created by another process on Apple, Qualcomm, and AMD GPUs. LeftoverLocals impacts the security posture of GPU applications, with particular significance to LLMs and ML models that run on impacted GPUs. By recovering local memory, an optimized GPU memory region, we built a PoC where an attacker can listen into another user's interactive LLM session (e.g., llama.cpp) across process or container boundaries.

연구 동기 및 목표

  • 공동 주행 프로세스가 로컬 메모리 영역에서 민감한 데이터를 복구할 수 있도록 하는 GPU 메모리 관리의 새로운 사이드채널 취약성을 식별하고 구현하는 것.
  • 특히 기밀성이 중요한 LLM 추론 워크로드에 대해 GPU 메모리 격리의 보안 영향을 조사하는 것.
  • 프로세스 종료 후 잔류 GPU 메모리에서 전체 LLM 응답을 복구할 수 있는지의 가능성을 평가하는 것.
  • 주요 GPU 제조사들과의 책임감 있는 취약성 공개를 위한 협력 및 GPU 생태계 전반의 강화된 보안 사양 도입을 위한 노력.
  • AI/ML 워크로드에 특히 중요한 GPU 시스템에 대해 공식화된 위협 모델과 철저한 보안 테스트를 촉구하는 것.

제안 방법

  • 사용 후 초기화되지 않은 GPU 로컬 메모리 영역에서 잔류 데이터를 측정하여, 최적화된 저지연성 액세스를 위한 GPU 로컬 메모리를 악용하는 것.
  • 공격 대상 프로세스가 이전에 사용한 메모리 위치에서 읽기 위해 OpenCL, Vulkan 또는 Metal을 사용해 GPU 커널을 실행하는 것.
  • 신호 대 노이즈 비율을 극대화하고 통계적 기법 및 패턴 매칭을 활용해 높은 정밀도로 데이터를 복원하기 위해 메모리 액세스 패턴을 설계하는 것.
  • 공격자 LLM 추론 프로세스(예: llama.cpp)와 같은 GPU에서 실행되는 개념 증명(PoC) 애플리케이션을 구축하여, 유출된 로컬 메모리에서 출력 토큰을 복원하는 것.
  • 여러 GPU 아키텍처(AMD, Apple M2/A17, Qualcomm, Imagination)에서 공격를 검증하고, 데이터 복원 정확도와 복구 용량을 측정하는 것.
  • CERT/CC 및 제조사들과의 협력적 공개 절차를 이행하며, 펌웨어 패치 테스트 및 보안 조치 상태 모니터링을 수행하는 것.
Figure 1 . An example of an LLM response that an attacker was able to reconstruct utilizing LeftoverLocals. The victim terminal is on the left (black background), and the attacker terminal is on the right (white backgroun). We can see that the attacker is able to reconstruct the response with relati
Figure 1 . An example of an LLM response that an attacker was able to reconstruct utilizing LeftoverLocals. The victim terminal is on the left (black background), and the attacker terminal is on the right (white backgroun). We can see that the attacker is able to reconstruct the response with relati

실험 결과

연구 질문

  • RQ1GPU 커널이 완료된 후 공격자가 공유된 프로세스가 GPU 로컬 메모리의 잔류 데이터를 어느 정도 복구할 수 있는가?
  • RQ2GPU 로컬 메모리 누출에서 얼마나 많은 LLM 출력 데이터를 복원할 수 있으며, 그 정밀도는 어떠한가?
  • RQ3Apple, AMD, Qualcomm, Imagination GPU 중 어떤 아키텍처가 이러한 유형의 메모리 누출에 취약한가?
  • RQ4이 취약성이 기밀성이 중요한 머신러닝 응용 프로그램에 실질적인 영향을 미치는가?
  • RQ5현재의 GPU 사양과 시스템 스택은 이러한 프로세스 간 메모리 누출을 방지하는 데 얼마나 효과적인가?

주요 결과

  • AMD Radeon RX 7900 XT에서 쿼리당 최대 181MB의 LLM 응답 데이터를 복구할 수 있으며, 이는 GPU 호출당 5.5MB의 로컬 메모리 누출로 인한 것이다.
  • 실시간 개념 증명에서 공격자가 피해자의 인터랙티브 LLM 세션에서 출력을 복원하는 것으로 입증되었듯이, 공격는 높은 정밀도로 전체 LLM 응답을 복원할 수 있다.
  • Apple의 M2 기반 MacBook Air는 일부 기기(예: iPad Air 3세대)에서 패치가 적용되었음에도 불구하고 여전히 취약하며, A17 및 M3 시리즈만 확정적으로 수정된 것으로 확인되었다.
  • AMD와 Qualcomm은 현재 조사 및 패치 작업을 진행 중이며, Qualcomm은 일부 기기에서 이 문제를 완화하는 펌웨어 업데이트(v2.07)를 발표했다.
  • Imagination GPU는 일부 설정에서는 영향을 받는 것으로 밝혀졌지만, 모든 테스트된 모델에서 영향을 받는 것은 아니었으며, DDK 23.3에서 수정 버전이 출시되었다.
  • NVIDIA 및 ARM GPU는 영향을 받지 않았으며, 이는 이전의 하드닝 및 보안 인식 조치로 인해 가능할 것으로 보인다.
Figure 2 . A simplified view of the GPU architecture: processing elements are partitioned into compute unites. All processing elements have access to global memory (often located in VRAM for discrete GPUs), while only processing elements in the same compute unit share the same local memory.
Figure 2 . A simplified view of the GPU architecture: processing elements are partitioned into compute unites. All processing elements have access to global memory (often located in VRAM for discrete GPUs), while only processing elements in the same compute unit share the same local memory.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.