Skip to main content
QUICK REVIEW

[論文レビュー] GradViT: Gradient Inversion of Vision Transformers

Ali Hatamizadeh, Hongxu Yin|arXiv (Cornell University)|Mar 22, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

GradViTは、事前学習済みのCNNを画像事前分布として用い、パッチ単位の全 variation 正則化、および動的損失スケジューリングを組み合わせることで、Vision Transformers (ViTs) の勾配を逆方向に再構成し、高精度の訓練画像を再構築する新規手法を提案する。本手法は、勾配逆方向推定分野で最先端の性能を達成し、注意機構に起因する情報漏洩のため、ViTsはCNNよりも脆弱であることが明らかになった。

ABSTRACT

In this work we demonstrate the vulnerability of vision transformers (ViTs) to gradient-based inversion attacks. During this attack, the original data batch is reconstructed given model weights and the corresponding gradients. We introduce a method, named GradViT, that optimizes random noise into naturally looking images via an iterative process. The optimization objective consists of (i) a loss on matching the gradients, (ii) image prior in the form of distance to batch-normalization statistics of a pretrained CNN model, and (iii) a total variation regularization on patches to guide correct recovery locations. We propose a unique loss scheduling function to overcome local minima during optimization. We evaluate GadViT on ImageNet1K and MS-Celeb-1M datasets, and observe unprecedentedly high fidelity and closeness to the original (hidden) data. During the analysis we find that vision transformers are significantly more vulnerable than previously studied CNNs due to the presence of the attention mechanism. Our method demonstrates new state-of-the-art results for gradient inversion in both qualitative and quantitative metrics. Project page at https://gradvit.github.io/.

研究の動機と目的

  • バッチ正規化層を備えないVision Transformers (ViTs) が勾配ベースの逆方向攻撃に対してどれほど脆弱であるかを調査すること。
  • アーキテクチャ上の相違により、従来のCNNベースの逆方向推定手法がViTの勾配から高精度な画像を再構築できない課題に対処すること。
  • ViTにバッチ正規化統計がないことに対応するため、外部の事前学習済みCNNを画像事前分布として用いる手法を開発すること。
  • 隣接するパッチ間の不連続性を最小化するパッチ事前分布損失を導入し、再構築画像の空間的整合性を回復すること。
  • データ漏洩に寄与する最も重要なViT勾配成分を同定し、今後の防御メカニズムの設計を支援すること。

提案手法

  • 対照的損失を用いて事前学習済みのResNet-50からバッチ正規化統計を抽出し、ViTの独自のBN層の代わりに画像事前分布として利用する。
  • 最適化されたノイズの勾配とViTモデルからのターゲット勾配を一致させるための勾配マッチング損失を採用する。
  • 隣接するパッチ間の全 variation を最小化するパッチ事前分布損失を導入し、空間的整合性を強化し、視覚的アーチファクトを低減する。
  • 勾配マッチング損失、画像事前分布損失、パッチ事前分布損失の寄与度を最適化中に動的に調整するカスタム損失スケジューリング関数を適用する。
  • 確率的勾配降下法を繰り返し適用してランダムノイズを最適化し、ターゲット勾配と自然画像の統計的性質を満たす画像を生成する。
  • アブレーションスタディを通じて、注意機構の高い情報含有量を活用し、データ漏洩におけるその役割を明確化する。

実験結果

リサーチクエスチョン

  • RQ1バッチ正規化層を備えないVision Transformersの勾配から、高精度な画像再構築が可能かどうか。
  • RQ2ViTsとCNNのアーキテクチャ的相違が、勾配逆方向推定攻撃の実現可能性と品質にどのように影響するか。
  • RQ3ViTアーキテクチャのうち、マルチヘッドアテンションかMLPブロックのどちらが勾配におけるデータ漏洩に寄与しているか。
  • RQ4ViTエンコーダーのどの層が勾配逆方向推定において最も情報を含んでおり、部分的な勾配共有によって漏洩を軽減可能か。
  • RQ5事前学習済みCNNがバッチ正規化のないモデルにおける勾配逆方向推定のための普遍的画像事前分布として機能可能か。

主な発見

  • GradViTは、ViT-B/16を用いてImageNet1KでPSNR 15.515を達成し、勾配逆方向推定分野で最先端の性能を示し、従来手法を著しく上回った。
  • 最後の3層(9–12)の勾配を除去すると再構築品質が著しく低下し、深層部が逆方向推定に最も重要な情報を含んでいることが示された。
  • マルチヘッド自己注意(MSA)コンponentはMLPコンponentよりもはるかに再構築精度に寄与しており、MSAのみの勾配ではPSNR 13.559、MLPのみでは12.256を記録した。
  • ViTsはCNNよりも勾配逆方向推定に対してより脆弱であり、PSNRが高く、バッチサイズが30であっても細部を回復できることが実証された。
  • 事前学習済みResNet-50から得た画像事前分布は、MS-Celeb-1Mの顔画像など多様なドメインに一般化可能であり、普遍性と頑健性を示した。
  • 提案された損失スケジューラーは、局所最適解を避け、有効な再構築を達成するために不可欠であり、固定された損失重みでは最適でない結果となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。