Skip to main content
QUICK REVIEW

[论文解读] GradViT: Gradient Inversion of Vision Transformers

Ali Hatamizadeh, Hongxu Yin|arXiv (Cornell University)|Mar 22, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

GradViT 提出了一种新颖的方法,通过从视觉变换器(ViTs)中反演梯度并重建高保真度的训练图像,该方法利用预训练的CNN作为图像先验,采用逐块总变差正则化以及动态损失调度器。该方法在梯度反演任务中达到最先进性能,揭示了由于注意力机制驱动的信息泄露,ViTs 比CNN更易受攻击。

ABSTRACT

In this work we demonstrate the vulnerability of vision transformers (ViTs) to gradient-based inversion attacks. During this attack, the original data batch is reconstructed given model weights and the corresponding gradients. We introduce a method, named GradViT, that optimizes random noise into naturally looking images via an iterative process. The optimization objective consists of (i) a loss on matching the gradients, (ii) image prior in the form of distance to batch-normalization statistics of a pretrained CNN model, and (iii) a total variation regularization on patches to guide correct recovery locations. We propose a unique loss scheduling function to overcome local minima during optimization. We evaluate GadViT on ImageNet1K and MS-Celeb-1M datasets, and observe unprecedentedly high fidelity and closeness to the original (hidden) data. During the analysis we find that vision transformers are significantly more vulnerable than previously studied CNNs due to the presence of the attention mechanism. Our method demonstrates new state-of-the-art results for gradient inversion in both qualitative and quantitative metrics. Project page at https://gradvit.github.io/.

研究动机与目标

  • 探究视觉变换器(ViTs)在缺乏批归一化层的情况下,对基于梯度的反演攻击的脆弱性。
  • 解决由于架构差异,以往基于CNN的反演方法无法实现从ViT梯度中重建高保真度图像的挑战。
  • 通过使用外部预训练的CNN作为图像先验,克服ViTs中缺乏批归一化统计量的问题。
  • 通过引入一种补丁先验损失,最小化相邻补丁之间的不连续性,以恢复重建图像的空间一致性。
  • 识别ViT梯度中最具信息量的组件,为未来防御机制提供指导。

提出的方法

  • 使用带有对比损失的预训练ResNet-50提取批归一化统计量作为图像先验,替代ViT自身所需的BN层。
  • 采用梯度匹配损失,使优化噪声的梯度与ViT模型的目标梯度对齐。
  • 引入一种补丁先验损失,通过最小化相邻补丁间的总变差,以增强空间一致性并减少视觉伪影。
  • 应用一种自定义的损失调度函数,在优化过程中动态平衡梯度匹配损失、图像先验损失和补丁先验损失的贡献。
  • 通过随机噪声的迭代优化,使用随机梯度下降生成与目标梯度和自然图像统计特性相匹配的图像。
  • 通过消融研究,利用注意力机制的高信息含量,隔离其在数据泄露中的作用。

实验结果

研究问题

  • RQ1尽管缺乏批归一化层,是否仍能从视觉变换器的梯度中实现高保真度图像重建?
  • RQ2ViTs与CNN之间的架构差异如何影响梯度反演攻击的可行性与质量?
  • RQ3ViT架构中的哪个组件——多头注意力还是MLP模块——对梯度中的数据泄露贡献最大?
  • RQ4ViT编码器中的哪些层对梯度反演最具信息量?是否可通过选择性梯度共享减轻数据泄露?
  • RQ5预训练的CNN能否作为无批归一化层模型中梯度反演的通用图像先验?

主要发现

  • GradViT在梯度反演任务中达到最先进性能,在ImageNet1K上使用ViT-B/16时PSNR达到15.515,显著优于先前方法。
  • 当移除最后三层(第9至12层)的梯度时,重建质量显著下降,表明深层包含反演最关键的特征信息。
  • 多头自注意力(MSA)组件对重建保真度的贡献远高于MLP组件,仅使用MSA梯度时PSNR为13.559,而仅使用MLP梯度时为12.256。
  • ViTs比CNN更易受梯度反演攻击,表现为重建保真度更高,且即使在批量大小为30时仍能恢复精细细节。
  • 从预训练ResNet-50提取的图像先验具有跨领域泛化能力,包括MS-Celeb-1M中的面部图像,证明其通用性与鲁棒性。
  • 所提出的损失调度器对避免局部极小值和实现有效重建至关重要,静态损失权重设置会导致次优结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。