Skip to main content
QUICK REVIEW

[論文レビュー] Influence Functions in Deep Learning Are Fragile

Samyadeep Basu, Philip Pope|arXiv (Cornell University)|Jun 25, 2020
Adversarial Robustness in Machine Learning参考文献 33被引用数 15
ひとこと要約

この論文は深層学習における影響関数の信頼性を調査し、多様なアーキテクチャとデータセットにおいてそれが脆いことを示している。大規模な実験を通じて、影響推定値が深層ネットワークにおいて著しく劣化すること、重み減衰やアーキテクチャに敏感であること、非凸性とヘッセ行列の近似誤差のためしばしば不正確であること、非凸設定における改善された推定器の必要性を示している。

ABSTRACT

Influence functions approximate the effect of training samples in test-time predictions and have a wide variety of applications in machine learning interpretability and uncertainty estimation. A commonly-used (first-order) influence function can be implemented efficiently as a post-hoc method requiring access only to the gradients and Hessian of the model. For linear models, influence functions are well-defined due to the convexity of the underlying loss function and are generally accurate even across difficult settings where model changes are fairly large such as estimating group influences. Influence functions, however, are not well-understood in the context of deep learning with non-convex loss functions. In this paper, we provide a comprehensive and large-scale empirical study of successes and failures of influence functions in neural network models trained on datasets such as Iris, MNIST, CIFAR-10 and ImageNet. Through our extensive experiments, we show that the network architecture, its depth and width, as well as the extent of model parameterization and regularization techniques have strong effects in the accuracy of influence functions. In particular, we find that (i) influence estimates are fairly accurate for shallow networks, while for deeper networks the estimates are often erroneous; (ii) for certain network architectures and datasets, training with weight-decay regularization is important to get high-quality influence estimates; and (iii) the accuracy of influence estimates can vary significantly depending on the examined test points. These results suggest that in general influence functions in deep learning are fragile and call for developing improved influence estimation methods to mitigate these issues in non-convex setups.

研究の動機と目的

  • 非凸最適化設定における深層ニューラルネットワークにおける影響関数の信頼性と正確性を評価すること。
  • ネットワークの深さ、幅、アーキテクチャ、正則化手法が影響推定の質に与える影響を調査すること。
  • ヘッセ行列の近似手法とモデルの収束が、影響推定の正確性に与える影響を評価すること。
  • 第一階層の影響関数が実世界の深層学習環境において果たす限界を実証的根拠で示すこと。
  • ResNet-50 などの大規模モデルにおける解釈可能性とモデルデバッグに影響関数を用いる可能性を検討すること。

提案手法

  • 浅いネットワーク(Iris, MNIST)、小規模なCNN、およびMNIST、CIFAR-10、ImageNetにおける深層アーキテクチャ(ResNets)のさまざまなモデルに対して、影響関数を実験的に評価する。
  • トレーニング後の影響スコアを計算するために、勾配とヘッセ・ベクトル積を用いた一次近似(第一階層のテイラー近似)を用いる。
  • 最適なモデルパラメータから再訓練した際の真値影響(leave-one-out再訓練による)と影響推定値を比較する。
  • Agarwalら(2016)の手法に由来する確率的ヘッセ・ベクトル積近似を適用し、その影響推定における誤差を評価する。
  • ピアソン相関係数とスピアマン順位相関係数を用いて、推定値と真値の影響の相関を測定する。
  • 最適パラメータからの再訓練戦略が、スクラッチからの再訓練に対する実用的代理指標として妥当であるかを、パラメータノルムの差と相関安定性を用いて検証する。

実験結果

リサーチクエスチョン

  • RQ1第一階層の影響関数は、leave-one-out再訓練による真値影響と比較して、深層ニューラルネットワークでどの程度正確か?
  • RQ2ネットワークの深さと幅は、非凸な深層学習設定における影響推定の信頼性にどのように影響するか?
  • RQ3重み減衰正則化は、影響推定の質を向上させる上で果たす役割は何か?
  • RQ4ヘッセ行列の近似手法は、大規模モデルにおける影響推定の正確性にどのように影響するか?
  • RQ5テストポイントの選択が、さまざまなアーキテクチャとデータセットにおいて影響推定の信頼性に与える影響は何か?

主な発見

  • 浅いネットワークでは影響推定値が比較的正確であるが、特にImageNetにおけるResNet-50のような深層アーキテクチャでは、徐々に誤りが多くなる。
  • 特定のアーキテクチャとデータセットでは、重み減衰正則化が高品質な影響推定値を得る上で不可欠である。
  • 影響推定の正確性は、選択されたテストポイントに大きく依存しており、局所的な損失関数の幾何構造に非常に敏感であることが示された。
  • 影響推定に用いられる確率的ヘッセ・ベクトル積近似は、しばしば誤りを含んでおり、推定品質の悪化に寄与している。
  • 最適パラメータからのleave-one-out再訓練によって得られる真値影響推定値は、特にResNet-50のような大規模モデルでは著しく変動が大きく、再訓練ベースライン自体の不安定性を示唆している。
  • ImageNetでは、推定値と真値の相関が非常に低く(0.15未満)、最適パラメータからの再訓練でさえも、両者の整合性が著しく低いことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。