Skip to main content
QUICK REVIEW

[论文解读] Sisyphus: A Cautionary Tale of Using Low-Degree Polynomial Activations in Privacy-Preserving Deep Learning

Karthik Garimella, Nandan Kumar Jha|arXiv (Cornell University)|Jul 26, 2021
Cryptography and Data Security被引用 8
一句话总结

本文研究了在隐私保护深度学习中,用低次多项式函数完全替代所有ReLU激活函数的可行性,以避免昂贵的混淆电路(garbled circuits)开销。尽管提出了诸如QuaIL和ApproxMinMaxNorm等新颖的训练策略,作者发现存在一种普遍存在的“激活逃逸问题”(escaping activation problem),即多项式激活函数在推理过程中因边界不稳定而发生爆炸或发散,最终表明必须使用精确的最小/最大值归一化——这反而造成了一个循环依赖,从而破坏了消除ReLU相关混淆电路的初衷。

ABSTRACT

Privacy concerns in client-server machine learning have given rise to private inference (PI), where neural inference occurs directly on encrypted inputs. PI protects clients' personal data and the server's intellectual property. A common practice in PI is to use garbled circuits to compute nonlinear functions privately, namely ReLUs. However, garbled circuits suffer from high storage, bandwidth, and latency costs. To mitigate these issues, PI-friendly polynomial activation functions have been employed to replace ReLU. In this work, we ask: Is it feasible to substitute all ReLUs with low-degree polynomial activation functions for building deep, privacy-friendly neural networks? We explore this question by analyzing the challenges of substituting ReLUs with polynomials, starting with simple drop-and-replace solutions to novel, more involved replace-and-retrain strategies. We examine the limitations of each method and provide commentary on the use of polynomial activation functions for PI. We find all evaluated solutions suffer from the escaping activation problem: forward activation values inevitably begin to expand at an exponential rate away from stable regions of the polynomials, which leads to exploding values (NaNs) or poor approximations.

研究动机与目标

  • 评估低次多项式激活函数是否能在不依赖混淆电路的前提下,完全替代隐私保护深度学习中的ReLU。
  • 探究现有“替换-重训练”策略在深层网络中对多项式激活函数的局限性。
  • 识别并分析基于多项式推理中不稳定的根源,特别是“激活逃逸问题”。
  • 确定近似归一化技术是否能有效在推理过程中限制激活值的范围。
  • 评估是否必须使用精确的最小/最大值计算,才能在深层复杂模型中稳定多项式激活函数。

提出的方法

  • 提出QuaIL,一种新颖的重训练策略:训练一个二次(x²)网络,使其模仿预训练全ReLU网络的中间特征。
  • 引入ApproxMinMaxNorm,一种归一化层,利用加权移动平均估算的最小值和最大值,对多项式应用前的输入进行边界限制。
  • 采用两阶段训练流程:首先训练标准ReLU网络;其次使用知识蒸馏从ReLU模型微调Quad网络。
  • 评估中采用“替换-重训练”策略(泰勒近似、多项式回归)与基于重训练的方法(QuaIL、ApproxMinMaxNorm)。
  • 通过比较使用近似值与真实最小/最大值的推理行为,隔离归一化精度对激活稳定性的影响。
  • 使用MNIST、CIFAR-10、CIFAR-100和TinyImageNet等标准基准数据集,评估模型准确率与激活动态。

实验结果

研究问题

  • RQ1低次多项式激活函数(如Quad,x²)是否能在隐私保护推理中完全替代深层神经网络中的ReLU?
  • RQ2使用知识蒸馏(QuaIL)进行重训练,是否能有效稳定深层网络中的多项式激活函数?
  • RQ3近似最小/最大值归一化技术在多大程度上可防止基于多项式的网络中出现激活爆炸?
  • RQ4为何即使经过归一化和重训练,基于多项式的网络仍会遭受不稳定性影响?
  • RQ5为实现基于多项式激活函数的稳定、高精度推理,是否必须使用精确的最小/最大值计算?

主要发现

  • 所有评估方法——包括替换-重训练、重训练策略及近似归一化——均遭受‘激活逃逸问题’影响,即推理过程中前向激活值无界增长。
  • 即使采用QuaIL训练,当使用近似最小/最大值时,ResNet32和MobileNetV1等深层网络中的激活值在推理阶段仍会发散。
  • 在推理过程中使用真实最小值和最大值(QuaIL+MM)可恢复稳定性,并达到与全ReLU基线相当的性能,证明精确边界值至关重要。
  • 近似最小/最大值在深层网络中引入累积误差,导致激活爆炸,尽管训练过程表现稳定。
  • 为稳定多项式激活函数而必须使用精确最小/最大值计算,形成了循环依赖:最小/最大值计算本身需要ReLU或混淆电路——而这正是该方法试图消除的。
  • 任何使用低次多项式的方法,若无精确最小/最大值边界,均无法在大型模型上实现稳定且准确的推理,导致当前方法在完全替代ReLU方面无效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。