[論文レビュー] Improving VAEs' Robustness to Adversarial Attack
本稿では、変分オートエンコーダー(VAEs)に対する敵対的攻撃に対する新たな防御を提案する。全相関(TC)正則化を活用することで、再構成品質を損なわず、潜在空間における敵対的攻撃に対する耐性を著しく向上させる。階層的VAEにTC正則化を適用した(通称:Seatbelt-VAE)手法により、高精度な再構成が実現されるとともに、潜在空間への敵対的攻撃に対して顕著な耐性を示し、標準的かつ単層正則化VAEを上回る性能を発揮する。
Variational autoencoders (VAEs) have recently been shown to be vulnerable to adversarial attacks, wherein they are fooled into reconstructing a chosen target image. However, how to defend against such attacks remains an open problem. We make significant advances in addressing this issue by introducing methods for producing adversarially robust VAEs. Namely, we first demonstrate that methods proposed to obtain disentangled latent representations produce VAEs that are more robust to these attacks. However, this robustness comes at the cost of reducing the quality of the reconstructions. We ameliorate this by applying disentangling methods to hierarchical VAEs. The resulting models produce high-fidelity autoencoders that are also adversarially robust. We confirm their capabilities on several different datasets and with current state-of-the-art VAE adversarial attacks, and also show that they increase the robustness of downstream tasks to attack.
研究の動機と目的
- 潜在空間における敵対的攻撃に対して脆弱である標準VAEの問題を解決すること。具体的には、微小な入力摂動によって再構成出力がターゲット画像に模倣されてしまう現象を対象とする。
- 特に全相関(TC)正則化を含む、分離性を促進する正則化子がVAEにおける敵対的耐性を向上させうるかを調査すること。
- 標準的TC正則化VAEでは見られる、耐性と再構成品質のトレードオフを、階層的アーキテクチャを用いることで克服すること。
- VAEエンコーダーを用いた後続タスクにおいて、敵対的攻撃に対する耐性がどのように拡張されるかを実証すること。
- 性能と耐性の両立を図る新たなモデルアーキテクチャ「Seatbelt-VAE」を設計・検証すること。
提案手法
- VAE学習中に変分目的関数に全相関(TC)正則化を適用し、入力摂動に対して感受性が低い、分離された確率的潜在表現を促進する。
- 次第に次元が低下する複数の潜在層を持つ階層的VAEアーキテクチャを採用し、各層の事後分布と事前分布をアンモライズド推論ネットワークでモデル化する。
- 階層的層に跨るマルチレベルTC正則化スキームを導入し、耐性を向上させつつ表現能力を維持する。
- 最適化の安定化を図るため、学習率をコサイン減衰させるADAMを用い、バッチサイズ1024でモデルを訓練する。
- 固定されたデコーダー分散(σ = 0.1)を適用し、Chenら(2018)が提案した標準的な畳み込み/逆畳み込み層を用いたエンコーダー・デコーダー構造を採用する。
- 潜在空間における敵対的攻撃を用いて耐性を評価し、再構成画像がターゲット画像とどれほど類似しているか、およびノイズを含む入力下での尤度を指標とする。
実験結果
リサーチクエスチョン
- RQ1VAEにおける全相関正則化は、潜在空間における敵対的攻撃に対する耐性を向上させうるか?
- RQ2標準的TC正則化VAEでは見られる再構成品質と敵対的耐性のトレードオフが、実用的導入を制限する要因となるか?
- RQ3TC正則化を施した階層的VAEは、高精度な再構成と強力な敵対的耐性の両方を達成できるか?
- RQ4VAEエンコーダーにおける耐性向上が、後続タスクにおける耐性向上にどのように拡張されるか?
- RQ5単層VAEと比較して、階層的構造が敵対的摂動に対するモデルの耐性に与える影響は何か?
主な発見
- 標準VAEにTC正則化を適用すると、敵対的耐性は向上するが、潜在表現の過剰な平滑化により再構成品質が著しく低下する。
- TC正則化を施した階層的VAE(通称:Seatbelt-VAE)は、標準VAEおよび単層TC正則化VAEと比較して顕著に優れた耐性を示す。
- CelebAデータセットにおいて、L=4層のSeatbelt-VAEは、強力な摂動に対しても元の入力(例:ヒュー・ジャックマン)の再構成を維持することができ、敵対的攻撃に対して効果的に耐性を示した。
- ノイズを含む入力下での元の入力の尤度が、β > 1のSeatbelt-VAEで顕著に高く、ノイズスケールにわたる耐性が向上していることが示された。
- 標準VAEと比較して、再構成忠実度を維持または向上させながらも、より高い耐性を達成しており、一般的に見られる品質-耐性トレードオフを解消した。
- VAEエンコーダーにおける敵対的攻撃に対する耐性は、後続タスクへと拡張され、それらのタスクにおける敵対的入力に対する耐性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。