[논문 리뷰] East: Efficient and Accurate Secure Transformer Framework for Inference
East는 GELU 및 tanh와 같은 비선형 함수를 가속화하기 위해 새로운 무관심 조각 다항식 평가(OPPE) 알고리즘을 사용하여 기밀 보장 Transformer 추론을 위한 안전하고 효율적이며 정확한 프레임워크를 제안한다. 이는 이전 기법 대비 런타임 1.5배 감소 및 통신량 2.6배 감소를 달성하며, 모델 재학습 없이도 정의된 정확도를 유지한다.
Transformer has been successfully used in practical applications, such as ChatGPT, due to its powerful advantages. However, users' input is leaked to the model provider during the service. With people's attention to privacy, privacy-preserving Transformer inference is on the demand of such services. Secure protocols for non-linear functions are crucial in privacy-preserving Transformer inference, which are not well studied. Thus, designing practical secure protocols for non-linear functions is hard but significant to model performance. In this work, we propose a framework \emph{East} to enable efficient and accurate secure Transformer inference. Firstly, we propose a new oblivious piecewise polynomial evaluation algorithm and apply it to the activation functions, which reduces the runtime and communication of GELU by over 1.5$ imes$ and 2.5$ imes$, compared to prior arts. Secondly, the secure protocols for softmax and layer normalization are carefully designed to faithfully maintain the desired functionality. Thirdly, several optimizations are conducted in detail to enhance the overall efficiency. We applied \emph{East} to BERT and the results show that the inference accuracy remains consistent with the plaintext inference without fine-tuning. Compared to Iron, we achieve about 1.8$ imes$ lower communication within 1.2$ imes$ lower runtime.
연구 동기 및 목표
- 기밀 보장 Transformer 추론에서 비선형 함수에 대한 효율적이고 정확한 보안 프로토콜의 부족을 해결한다.
- 클라이언트 입력 기밀성과 서버 모델 파라미터 기밀성을 모두 보존하는 보안 추론을 가능하게 한다.
- 재학습이나 아키텍처 수정 없이도 원본 모델 아키텍처를 유지한다.
- 이전에 통신 비용의 최대 87%를 차지했던 보안 비선형 함수의 성능 오버헤드를 감소시킨다.
- 오차 누출을 최소화한 MPC 우수 프로토콜을 설계하여 GELU, tanh, 소프트맥스, 레이어 정규화에 최적화된 프로토콜을 제공한다.
제안 방법
- GELU 및 tanh와 같은 비선형 함수를 조각 다항식 근사법을 사용해 안전하게 평가하기 위해 새로운 무관심 조각 다항식 평가(OPPE) 알고리즘을 제안한다.
- 오차 제한된 변환 방법과 비밀 공유를 활용하여 정확성과 기밀성을 보장하는 소프트맥스 및 레이어 정규화를 위한 보안 프로토콜을 설계한다.
- Beaver 트리플 사용량을 줄이고 효율적인 사전 계산을 활용하여 오프라인 및 온라인 단계를 최적화하여 통신 및 런타임을 향상시킨다.
- BERT의 전체 추론 파이프라인에 프로토콜를 통합하여 원본 모델 구조를 유지하고 재학습을 피한다.
- 보안성과 정확성을 보장하기 위해 히든 암호화(HE)와 비밀 공유(SS)를 기반 암호 primitive로 사용한다.
- GELU(d=3, m=8) 및 tanh(d=3, m=7)와 같은 함수에 대해 차원별 최적화를 적용하여 정확도와 효율성의 균형을 이룬다.
실험 결과
연구 질문
- RQ1기밀 보장 Transformer 추론 환경에서 GELU 및 tanh와 같은 비선형 함수를 최소한의 성능 오버헤드로 안전하게 평가할 수 있는가?
- RQ2새로운 무관심 평가 방법이 룩업 테이블 기반 접근법에 비해 비선형 함수의 통신 및 런타임 비용을 줄일 수 있는가?
- RQ3MPC 기반 추론에서 소프트맥스 및 레이어 정규화 프로토콜를 얼마나 정확하고 효율적으로 설계할 수 있는가?
- RQ4재학습 없이도 원본 모델 아키텍처를 유지하면서도 평판 모델 수준에 가까운 성능을 달성할 수 있는가?
- RQ5런타임, 통신, 추론 정확도 측면에서 Iron과 같은 최신 기술 대비 제안된 프레임워크는 어떻게 비교되는가?
주요 결과
- 제안된 OPPE 알고리즘은 NFGen이라는 이전 최고 성능 기법 대비 GELU의 통신 비용을 2.6배 감소시키고 런타임을 1.5배 감소시킨다.
- GELU에 대해 East는 현재 보안 Transformer 추론 분야의 최고 성능(SOTA)인 Iron 대비 런타임 1.5배 감소 및 통신량 2.9배 감소를 달성한다.
- 보안 소프트맥스 및 레이어 정규화 프로토콜는 입력 차원에 따라 선형적으로 확장되며, 각각 1000차원 입력에 대해 약 5초 및 약 2초의 런타임을 차지한다.
- East는 테스트 벤치마크 전반에서 정의된 정확도를 그대로 유지하며, F1 점수, 정밀도, 재현율, 정확도에 하락이 없이 정확도를 그대로 유지한다.
- Iron 대비 총 통신량을 1.8배 감소시키고 런타임을 1.2배 감소시켜 BERT-Base 추론에서 약 256초 및 약 30GB의 통신량 절감을 이룬다.
- Beaver 트리플 사용량 감소로 인해 오프라인 단계에서 최대 3배의 최적화가 이루어져 사전 계산 효율성이 크게 향상된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.