Skip to main content
QUICK REVIEW

[논문 리뷰] SESAME: Software defined Enclaves to Secure Inference Accelerators with Multi-tenant Execution

Sarbartha Banerjee, Prakash Ramrakhyani|arXiv (Cornell University)|2020. 07. 14.
Security and Verification in Computing참고 문헌 57인용 수 6
한 줄 요약

SESAME는 다중 멀티테넌트 추론 가속기용 소프트웨어 정의된 에클레임(software-defined enclaves, SDE)을 도입하여 컴파일러 최적화된 개인 큐와 트래픽 샤퍼를 사용함으로써 위협 모델에 맞춘 보안을 실현하며, 성능 오버헤드는 3.96%에서 34.87%의 범위를 보인다. 이 프레임워크는 DAE 기반 가속기에서 계산적 비상호작용을 보장하고 사이드채널 유출을 방지한다. VGG, ResNet, AlexNet 등의 모델에 대해 성능과 보안을 동시에 확보한다.

ABSTRACT

Hardware-enclaves that target complex CPU designs compromise both security and performance. Programs have little control over micro-architecture, which leads to side-channel leaks, and then have to be transformed to have worst-case control- and data-flow behaviors and thus incur considerable slowdown. We propose to address these security and performance problems by bringing enclaves into the realm of accelerator-rich architectures. The key idea is to construct software-defined enclaves (SDEs) where the protections and slowdown are tied to an application-defined threat model and tuned by a compiler for the accelerator's specific domain. This vertically integrated approach requires new hardware data-structures to partition, clear, and shape the utilization of hardware resources; and a compiler that instantiates and schedules these data-structures to create multi-tenant enclaves on accelerators. We demonstrate our ideas with a comprehensive prototype -- Sesame -- that includes modifications to compiler, ISA, and microarchitecture to a decoupled access execute (DAE) accelerator framework for deep learning models. Our security evaluation shows that classifiers that could distinguish different layers in VGG, ResNet, and AlexNet, fail to do so when run using Sesame. Our synthesizable hardware prototype (on a Xilinx Pynq board) demonstrates how the compiler and micro-architecture enables threat-model-specific trade-offs in code size increase ranging from 3-7 $\%$ and run-time performance overhead for specific defenses ranging from 3.96$\%$ to 34.87$\%$ (across confidential inputs and models and single vs. multi-tenant systems).

연구 동기 및 목표

  • 기존 하드웨어 에클레임이 최악의 경우 가정에 기반해 성능 저하와 사이드채널 유출을 겪는 문제를 해결한다.
  • 일반적인 CPU 기반 기밀 계산과 가속기 중심 아키텍처 간 격차를 좁히기 위해 도메인 특화 가속기에서 안전하고 효율적인 추론을 가능하게 한다.
  • 에클레임 내에서 애플리케이션 특화 위협 모델링을 가능하게 하여, 일괄적인 보호 조치를 강제하는 대신 실제 위협 모델에 따라 성능과 보안이 유연하게 확장되도록 한다.
  • 콘텐션 및 관찰 채널을 통해 발생하는 사이드채널 유출을 방지하기 위해 RTL 수준에서 새로운 하드웨어 데이터 구조—개인 큐와 트래픽 샤퍼—를 설계하고 통합한다.
  • 컴파일러 스택을 통해 SDE를 자동 생성할 수 있도록 하며, 보안을 확보하면서도 성능과 자원 활용도를 최적화하는 코드 스케줄링 및 주석 처리를 지원한다.

제안 방법

  • 분리된 액세스-실행(DAE) 가속기 프레임워크에 컴파일러, ISA 확장, 마이크로아키텍처 수정을 융합한 수직 통합 스택을 도입한다.
  • RTL 수준에서 두 가지 새로운 데이터 구조를 설계한다: 공유 하드웨어 자원을 분할하여 콘텐션 채널 유출을 방지하는 개인 큐와, 기밀 데이터에서 관찰 채널을 분리하는 트래픽 샤퍼.
  • 컴파일러 자동 최적화를 통해 실행 변동성 또는 메모리 액세스 패턴을 통한 기밀 정보 유출을 방지하면서도 성능을 극대화하는 타일링 스케줄을 생성한다.
  • 프로그램 단계 인식 기반 트래픽 분포를 컴파일 타임에 학습한 소프트웨어 설정 가능한 트래픽 샤퍼를 지원하며, 하드웨어 전용 가짜화 기법보다 간단하다.
  • ISA 확장과 드라이버 수준 설정을 통해 위협 모델 기반 방어 조치(개인 큐 및 트래픽 샤퍼)를 통합하여, 배포 환경에 따라 동적으로 최적화할 수 있도록 한다.
  • Xilinx Pynq 기반의 합성 가능한 RTL 프로토타입을 사용해 실세계 모델(VGG, ResNet, AlexNet 포함)을 대상으로 다중 멀티테넌트 환경(시간적 및 공간적 공유)에서 성능과 보안을 평가한다.

실험 결과

연구 질문

  • RQ1소프트웨어 정의된 에클레임은 도메인 특화 가속기 적용에 효과적으로 활용될 수 있는가? 이는 강력한 보안 보장을 유지하면서 성능 오버헤드를 줄일 수 있는가?
  • RQ2개인 큐와 트래픽 샤퍼를 RTL 및 컴파일러 수준에서 공동 설계함으로써 다중 멀티테넌트 가속기 실행 중 사이드채널 유출을 방지할 수 있는가?
  • RQ3일반적인 TEE의 단일 크기의 보편적 보호 조치 대비, 위협 모델 기반 보안 최적화는 얼마나 성능 오버헤드를 줄일 수 있는가?
  • RQ4다양한 위협 모델(온칩 대비 오프칩 가시성)과 공유 모드(시간적 대비 공간적 공유)에서 성능 오버헤드는 어떻게 변화하는가?
  • RQ5제안된 프레임워크는 딥 러닝 모델의 서로 다른 레이어를 구분하는 분류기가 존재하지 않도록 하여 사이드채널 분석에 대한 저항성을 입증할 수 있는가?

주요 결과

  • Sesame는 VGG, ResNet, AlexNet에서 레이어 간을 구분하는 사이드채널 분류기를 효과적으로 차단하여 온칩 및 오프칩 신호 유출에 대한 보호를 입증한다.
  • 시간적 공유 모드에서 QARMA128 기반 오버헤드는 3.77%에서 25.81%까지, AES128 암호화 기반 오버헤드는 4.92%에서 34.87%까지 위협 모델과 모델 복잡도에 따라 변동한다.
  • 공간적 공유 모드에서는 자원이 네 명의 테넌트가 균등하게 분할받는 조건에서 오버헤드가 더 낮으며, QARMA128 기반으로 3.31%에서 12.78%까지, AES128 기반으로 4.86%에서 16.73%까지 변동한다. 특히 메모리 대역폭이 이미 병목이 되는 대규모 모델(VGG, AlexNet)에서는 더욱 유리하다.
  • 컴파일러 주석과 하드웨어 인스턴스화로 인해 코드 크기가 3~7% 증가하지만, 일반적인 TEE의 최악의 경우 보안 조치에 비해 이는 극히 미미한 비용이다.
  • 트래픽 샤퍼 유닛은 소프트웨어가 학습한 트래픽 패턴에 기반하기 때문에 이전의 하드웨어 전용 샤퍼보다 간단하며, RTL 복잡도를 감소시키면서도 강력한 보안을 유지한다.
  • 암호화, 무결성 검사, ORAM 등의 다른 TEE 기반 기능과 조합 가능하며, 향후 그래프 워크로드 및 일반 목적 CPU 지원을 위한 확장도 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.