[논문 리뷰] LLMs Can Understand Encrypted Prompt: Towards Privacy-Computing Friendly Transformers
이 논문은 동형 암호화(HE)와 보안 다자간 계산(MPC) 환경에서 사용 가능한 대체 방식으로, 프라이버시에 불리한 비선형 연산—예를 들어 GELU, 소프트맥스, 레이어 정규화—를 효율적으로 대체하는 프라이버시 컴퓨팅 친화적인 트랜스포머 아키텍처를 제안한다. 이러한 계산적으로 부담스러운 구성 요소를 대체함으로써, 상태기반 기술인 Iron과 비교해 계산 속도는 5배 향상되고 통신 오버헤드는 80% 감소시키며, 대규모 언어 모델(LLM) 추론 시 거의 동일한 모델 정확도를 유지한다.
The community explored to build private inference frameworks for transformer-based large language models (LLMs) in a server-client setting, where the server holds the model parameters and the client inputs its private data (or prompt) for inference. However, these frameworks impose significant overhead when the private inputs are forward propagated through the original LLMs. In this paper, we show that substituting the computation- and communication-heavy operators in the transformer architecture with privacy-computing friendly approximations can greatly reduce the private inference costs while incurring very minor impact on model performance. Compared to state-of-the-art Iron (NeurIPS 2022), our privacy-computing friendly model inference pipeline achieves a $5 imes$ acceleration in computation and an 80% reduction in communication overhead, while retaining nearly identical accuracy.
연구 동기 및 목표
- 동형 암호화(HE)와 보안 다자간 계산(MPC)를 사용한 트랜스포머 기반 LLM의 프라이버시 추론에서 높은 계산 및 통신 오버헤드 문제를 해결하기 위해.
- GELU, 소프트맥스, 레이어 정규화와 같은 프라이버시 컴퓨팅에 불리한 연산자를 프라이버시 추론에서 성능 저하의 주요 원인으로 규명하기 위해.
- 이러한 비선형 연산자의 프라이버시 컴퓨팅 우수한 근사치를 설계하여, 모델 정확도를 유지하면서 암호화 비용을 크게 감소시키기 위해.
- 프라이버시 계산 환경에서의 추론 시간, 통신 비용, 정확도 측면에서 수정된 모델의 종단 간 성능을 평가하기 위해.
제안 방법
- 저자는 트랜스포머 기반 LLM에 대해 HE와 MPC를 완전히 지원하는 프라이버시 추론 시스템을 구현하여 암호화된 입력에서의 안전한 계산을 가능하게 한다.
- GELU, 소프트맥스, 레이어 정규화가 프라이버시 추론에서 전체 비용의 70% 이상을 차지하는 주요 비용 기여 요소임을 규명한다.
- 이들 연산자를 프라이버시 컴퓨팅 우수한 대체 연산으로 교체한다: GELU는 ReLU로, 소프트맥스는 다항식 근사치로, 정규화 레이어는 간소화된 형태로 대체한다.
- 수정된 모델는 성능을 유지하기 위해 미세조정되며, 프라이버시 추론 하에서 원본 모델과 거의 동일한 정확도를 확보한다.
- 시스템은 선형 연산에는 HE를, 비선형 연산에는 MPC를 사용하며, 최적화된 데이터 인코딩 및 배치 전략을 적용한다.
- 여러 LLM(예: BERT-Tiny, BERT-Medium, RoBERTa-Base)을 대상으로 원본 모델과 수정된 모델 간의 종단 간 계산 및 통신 비용을 측정한다.

실험 결과
연구 질문
- RQ1HE와 MPC를 사용한 트랜스포머 기반 LLM의 프라이버시 추론에서 주요 계산 및 통신 병목 현상은 무엇인가?
- RQ2GELU, 소프트맥스, 레이어 정규화와 같은 비선형 연산자의 프라이버시 컴퓨팅 우수한 근사치를 적용하면 정확도 손실 없이 추론 오버헤드를 크게 줄일 수 있는가?
- RQ3Iron과 같은 최첨단 프라이버시 추론 시스템과 비교해 제안된 프레임워크의 속도 및 통신 효율성 측면에서 성능은 어떠한가?
- RQ4비선형 연산자를 HE/MPC 우수한 대체 연산으로 교체함으로써 종단 간 프라이버시 LLM 추론의 정확도에 어떤 영향을 미치는가?
- RQ5제안된 방법은 BERT-Tiny, RoBERTa-Base와 같은 다양한 LLM 아키텍처에서 확장 가능하며, 고도의 효율성과 프라이버시 보장을 유지할 수 있는가?
주요 결과
- 제안된 프라이버시 컴퓨팅 친화적 모델은 RoBERTa-Base에서 Iron 대비 추론 시간을 최대 5.7배 빠르게 하여 원본 모델의 168.43초에서 최적화된 버전은 84.50초로 단축시켰다.
- 통신 비용은 원본 모델의 6.38GB에서 최적화된 버전의 1.14GB로 최대 5.6배 감소시켰다.
- 전체 프라이버시 추론 비용은 80% 감소했으며, 그 중 가장 큰 절감 효과는 GELU, 소프트맥스, 정규화 레이어 교체에서 기인했다.
- 수정된 BERT-Tiny 모델에서 종단 간 프라이버시 추론은 원본 모델의 평문 추론보다 약간 더 높은 정확도를 기록하여 성능 안정성 또는 향상을 시사한다.
- 최적화된 모델의 통신 비용은 원본 모델의 비용의 13%에 불과하여 데이터 전송 효율성 향상이 뚜렷하게 나타났다.
- 모든 평가 데이터셋에서 원본 모델과 거의 동일한 정확도를 유지함으로써, 아키텍처 수정에도 불구하고 성능 저하가 최소한으로 발생했음을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.