[論文レビュー] How explainable are adversarially-robust CNNs?
本研究は、5つのアーキテクチャと3つの訓練手法を用いて12のImageNetで訓練されたCNNにおける、テスト精度、分布外(OOD)耐性、解釈可能性の相互作用について、初めての大規模評価を実施した。その結果、敵対的に耐性のあるCNNは勾配ベースの属性割り当て手法(例:GradCAM)において顕著に解釈可能性が高く、AdvPropモデル—高い精度を達成しているが—解釈可能性においても強力なロバストモデルに劣ることなく、GradCAMとRISEは、すべての指標とモデルにおいて一貫して上位を占めることがわかった。
Three important criteria of existing convolutional neural networks (CNNs) are (1) test-set accuracy; (2) out-of-distribution accuracy; and (3) explainability. While these criteria have been studied independently, their relationship is unknown. For example, do CNNs that have a stronger out-of-distribution performance have also stronger explainability? Furthermore, most prior feature-importance studies only evaluate methods on 2-3 common vanilla ImageNet-trained CNNs, leaving it unknown how these methods generalize to CNNs of other architectures and training algorithms. Here, we perform the first, large-scale evaluation of the relations of the three criteria using 9 feature-importance methods and 12 ImageNet-trained CNNs that are of 3 training algorithms and 5 CNN architectures. We find several important insights and recommendations for ML practitioners. First, adversarially robust CNNs have a higher explainability score on gradient-based attribution methods (but not CAM-based or perturbation-based methods). Second, AdvProp models, despite being highly accurate more than both vanilla and robust models alone, are not superior in explainability. Third, among 9 feature attribution methods tested, GradCAM and RISE are consistently the best methods. Fourth, Insertion and Deletion are biased towards vanilla and robust models respectively, due to their strong correlation with the confidence score distributions of a CNN. Fifth, we did not find a single CNN to be the best in all three criteria, which interestingly suggests that CNNs are harder to interpret as they become more accurate.
研究の動機と目的
- テストセット精度、分布外(OOD)精度、および解釈可能性の間の関係を調査すること。
- 9つの最先端の特徴属性割り当て手法が、多様なCNNアーキテクチャおよび訓練アルゴリズムにどのように一般化するかを評価すること。
- 敵対的耐性のあるモデルが、標準(バニラ)モデルよりも解釈可能性が高いかどうか、およびAdvPropで訓練されたモデルが解釈可能性を向上させているかどうかを評価すること。
- 挿入法と削除法といった一般的な評価指標に内在するバイアスを特定し、特にスコアベースの指標(挿入/削除)とモデルの信頼度スコアとの相関関係を分析すること。
- 実務家が耐性があり、精度が高く、解釈可能なCNNおよび属性割り当て手法を選択するうえでの実用的アドバイスを提供すること。
提案手法
- 12のImageNetで訓練されたCNNに対して、9つの特徴属性割り当て手法(GradCAM、RISE、GradCAM++、SmoothGrad、Integrated Gradients、CAM、Grad-CAM、SmoothGrad、Integrated Gradients)を評価した。
- 5つのCNNアーキテクチャ(ResNet、DenseNet、EfficientNet、MobileNet、Wide ResNet)と3つの訓練アルゴリズム(バニラ、敵対的耐性あり(PGD-1)、AdvProp(PGD-1にデータミックスを適用))を用いた。
- 属性割り当てマップの品質を評価するために、4つの評価指標(ポイントゲーム(PG)、弱教師付き局所化(WSL)、挿入、削除)を適用した。
- 公平な比較を確保するため、各属性割り当て手法と各モデルについて、粗いグリッドサーチを用いてハイパーパramータチューニングを実施した。
- 属性割り当てスコアとモデルの信頼度分布との相関関係を分析し、特にスコアベースの指標(挿入/削除)に注目した。
- 統計的分析を用いて、アーキテクチャおよび訓練手法ごとの解釈可能性性能を比較し、結果を可視化した。
実験結果
リサーチクエスチョン
- RQ1敵対的耐性のあるCNNは、さまざまな属性割り当て手法において、バニラモデルよりも高い解釈可能性を示すか?
- RQ2高いテスト精度およびOOD精度を達成しているにもかかわらず、AdvPropで訓練されたモデルは、バニラモデルおよびロバストモデルと比較して、解釈可能性において優れているか?
- RQ3どの特徴属性割り当て手法が、多様なアーキテクチャおよび訓練手法において一貫して最高の性能を発揮するか?
- RQ4挿入法と削除法の指標は、モデルの信頼度スコアとの相関関係により、特定のモデルタイプに強くバイアスを受ける程度はどの程度か?
- RQ5テスト精度、OOD精度、解釈可能性の3つの基準をすべて満たす単一のCNNアーキテクチャまたはモデルが存在するか?
主な発見
- 敵対的耐性のあるCNNは、勾配ベースの属性割り当て手法(特にGradCAMとRISE)を用いて評価した際、バニラモデルよりも顕著に高い解釈可能性スコアを示した。
- 高精度なテストセットおよびOOD精度を達成しているにもかかわらず、AdvPropモデルは、4つの評価指標すべてにおいて、敵対的耐性のあるモデルに劣る解釈可能性を示した。
- GradCAMとRISEは、12のすべてのモデルおよび4つの評価指標において、常に上位3位以内に位置づけられ、信頼性の高い選択肢であることが示唆された。
- 挿入法と削除法の指標は強くバイアスを受けており、挿入法は信頼度スコアが高いためバニラモデルを好む傾向にあり、削除法はより保守的な予測を行うロバストモデルを好む傾向にある。
- テスト精度、OOD精度、解釈可能性の3つの基準をすべて満たす単一のCNNモデルは存在せず、性能と解釈可能性の間に根本的なトレードオフが存在することが示された。
- ResNet-50は、すべての指標の平均で最も優れた性能を示したが、DenseNet-161が最高のテストセット精度を記録しているにもかかわらず、より高い精度が解釈可能性を高めるとは限らないことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。