[論文レビュー] Exploiting the Relationship Between Kendall's Rank Correlation and Cosine Similarity for Attribution Protection
本稿では、自然入力と摂動付き入力のAttribution間のコサイン類似度を最大化することで、順位関係の安定性を向上させる統合勾配正則化項(IGR)を提案する。理論的にコサイン類似度と Kendall 順位相関の正の相関関係を示し、Attributionの安定性のための微分可能な代替指標を提供する。実験では、IGRが複数のモデルおよびデータセットでAttributionの安定性と敵対的安定性の両方を向上させ、最先端手法を上回ることを示す。
Model attributions are important in deep neural networks as they aid practitioners in understanding the models, but recent studies reveal that attributions can be easily perturbed by adding imperceptible noise to the input. The non-differentiable Kendall's rank correlation is a key performance index for attribution protection. In this paper, we first show that the expected Kendall's rank correlation is positively correlated to cosine similarity and then indicate that the direction of attribution is the key to attribution robustness. Based on these findings, we explore the vector space of attribution to explain the shortcomings of attribution defense methods using $\ell_p$ norm and propose integrated gradient regularizer (IGR), which maximizes the cosine similarity between natural and perturbed attributions. Our analysis further exposes that IGR encourages neurons with the same activation states for natural samples and the corresponding perturbed samples, which is shown to induce robustness to gradient-based attribution methods. Our experiments on different models and datasets confirm our analysis on attribution protection and demonstrate a decent improvement in adversarial robustness.
研究の動機と目的
- 微小な入力摂動によって引き起こされる順位関係の破壊に脆弱なモデルAttributionの問題に対処すること。
- 微分不能でありAttributionの安定性に不可欠な Kendall 順位相関を保持できない ℓp-ノルム正則化項の限界を克服すること。
- Attributionの安定性向上に寄与するコサイン類似度と Kendall 順位相関の幾何的関係を確立すること。
- 自然入力と摂動付き入力の間で一貫したニューロン活性化パターンを促進する微分可能な正則化項を構築すること。
- 提案された IGR 正則化項が深層ニューラルネットワークにおける Attribution の安定性および敵対的安定性の両方を向上させることを実証的に検証すること。
提案手法
- 理論的分析により、特定の仮定の下で Kendall 順位相関とコサイン類似度の正の相関関係を証明し、Attributionの安定性のための微分可能な代替指標を提供する。
- 自然入力と摂動付き入力のAttributionベクトル間のコサイン類似度を最大化するように、統合勾配正則化項(IGR)を提案する。
- IGR を敵対的訓練フレームワークに統合し、Attributionの安定性と通常の敵対的安定性の両方を同時に最適化する。
- ニューロンが自然入力と摂動付き入力の両方で同じ活性化状態(符号)を保つように促進し、安定性を向上させる。
- バックプロパゲーション中に、Attributionベクトルを計算するために統合勾配を用い、Attribution機構を通り抜ける勾配の流れを保証する。
- 実験では、MNIST、Fashion-MNIST、CIFAR-10 などの複数のデータセットとモデルを用い、ベースラインおよび最先端の防御手法と比較して IGR の有効性を評価する。
実験結果
リサーチクエスチョン
- RQ1Attributionの安定性において、Kendall 順位相関の信頼できる微分可能な代理指標は存在するか?また、コサイン類似度はそのような代理指標として適切か?
- RQ2微小な入力摂動を維持しているにもかかわらず、ℓp-ノルムベースの正則化項がなぜAttributionの安定性を保持できないのか?
- RQ3ベクトルのなす角度に基づく幾何的視点は、Attribution手法の安定性を説明できるか?
- RQ4Attribution間のコサイン類似度を最適化することで、自然入力と摂動付き入力の両方で一貫したニューロン活性化パターンが得られるか?
- RQ5提案された IGR 正則化項は、同時に Attribution の安定性と敵対的安定性の両方を向上させることができるか?
主な発見
- IGR は Attribution の安定性を顕著に向上させ、PGD20 攻撃下で CIFAR-10 で最高の Kendall 順位相関(0.945)を達成した(TRADES+IGR)。
- IGR モデルの活性化一貫性は常にベースラインを上回り、Fashion-MNIST では MART+IGR が 0.69 を達成したのに対し、ベースラインは 0.67 であった。
- IGR はすべてのデータセットで敵対的安定性を向上させた:MNIST では AT+IGR が FGSM 正答率 99.45% を達成し、ベースラインの 99.39% から向上した。
- CIFAR-10 では MART+IGR が PGD20 正答率 79.93% を達成し、MART ベースライン(77.91%)から 2.02% の向上を示した。
- 9回の評価のうち7回で自然正答率が維持または向上し、一般化性能の低下がないことが示された。
- 理論的および実験的結果により、IGR が自然入力と摂動付き入力の両方で同じ符号でニューロンを活性化させるよう促進することを確認した。これにより、提示された幾何的解釈が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。