Skip to main content
QUICK REVIEW

[論文レビュー] B-cos Alignment for Inherently Interpretable CNNs and Vision Transformers

Moritz Böhle, Navdeeppal Singh|arXiv (Cornell University)|Jun 19, 2023
Explainable Artificial Intelligence (XAI)被引用数 4
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)およびビジョントランスフォーマーにおける線形層の即座の置き換えとして、トレーニング中に重みと入力の整合性を促進するB-cos変換を導入する。これにより、本質的に解釈可能なモデルが得られ、1つの線形変換でネットワーク全体を要約する忠実で人間が解釈可能な説明が可能となり、ImageNetのトップ-1精度が80%以上を維持したまま、最先端の説明品質を達成する。

ABSTRACT

We present a new direction for increasing the interpretability of deep neural networks (DNNs) by promoting weight-input alignment during training. For this, we propose to replace the linear transformations in DNNs by our novel B-cos transformation. As we show, a sequence (network) of such transformations induces a single linear transformation that faithfully summarises the full model computations. Moreover, the B-cos transformation is designed such that the weights align with relevant signals during optimisation. As a result, those induced linear transformations become highly interpretable and highlight task-relevant features. Importantly, the B-cos transformation is designed to be compatible with existing architectures and we show that it can easily be integrated into virtually all of the latest state of the art models for computer vision - e.g. ResNets, DenseNets, ConvNext models, as well as Vision Transformers - by combining the B-cos-based explanations with normalisation and attention layers, all whilst maintaining similar accuracy on ImageNet. Finally, we show that the resulting explanations are of high visual quality and perform well under quantitative interpretability metrics.

研究の動機と目的

  • 後処理による説明手法に依存せずに、深層ニューラルネットワークを本質的に解釈可能にする挑戦に応えること。
  • トレーニング中にネットワークの重みとタスクに関連する入力信号との整合性を促進するニューラルネットワーク層を設計すること。
  • 得られるモデルの説明が、内部計算の忠実な要約であり、同時に人間が視覚的に解釈可能なこと。
  • 両方のアーキテクチャ(畳み込み型とアテンションベース)の解釈性を著しく向上させつつ、高いモデル精度を維持すること。

提案手法

  • 標準的な線形変換の代替として、最適化中に入力依存の重み-入力整合性を誘導する、B-cos変換を提案する。
  • B-cos変換により、このような層の任意のシーケンスが、与えられた入力に対してモデルの内部計算を忠実に反映する1つの線形変換に要約可能であることを保証する。
  • 説明における不自然なエッジやコーナーのアーチファクトを回避するため、明示的なバイアス項(b(x) = 0)を明確に回避することで、解釈性を向上させる。
  • 最適化の目的関数を変更することで、バッチ正則化およびアテンション機構とB-cos層を統合し、解釈性を維持しながらトレーニングの安定性を保つ。
  • 再パrameter化されたターゲットエンコーディングを用いた修正された交差エントロピー損失を採用し、モデルが陽性クラススコアのためのオブジェクト特徴に依存するよう促進する。これにより、負のバイアス補正への依存を低減する。
  • 平均補正済みのロジットおよび説明を用いて、モデル出力の特異性および人間の解釈可能性を評価・向上させる。

実験結果

リサーチクエスチョン

  • RQ1後処理手法に依存せずに、本質的に解釈可能な忠実な説明を生み出すために、線形変換を変更できるか?
  • RQ2トレーニング中に重み-入力整合性をどのように促進すれば、モデル表現の解釈性を高められるか?
  • RQ3B-cos変換は、ResNets、DenseNets、ConvNeXt、Vision Transformersといった現代のアーキテクチャにどの程度統合可能であり、精度を維持できるか?
  • RQ4B-cos層の使用は、標準モデルおよび既存の説明手法と比較して、定性的および定量的両方の解釈性指標を向上させるか?
  • RQ5最適化の目的関数を再設計することで、モデルが画像のエッジなどの不自然な特徴に依存してバイアスを計算するのを防ぎ、説明の明確さを向上させられるか?

主な発見

  • B-cosネットワークは、ResNets、DenseNets、ConvNeXt、Vision Transformersを含む複数のアーキテクチャでImageNetにおいて80%を超えるトップ-1精度を達成し、標準モデルと比較して僅かな性能低下にとどまる。
  • B-cosの説明は定性的に優れており、オブジェクトの部分などタスクに関連する特徴を明確に強調しており、視覚的品質および解釈性指標において既存の説明手法を上回る。
  • 平均補正済みの説明(E’)から、標準的なBCE損失で学習されたモデルは、すべてのクラスで画像のエッジを陽性バイアスに使用していることが判明した。これは、ターゲットを陽性証拠に焦点を合わせるよう最適化ターゲットを再定義することで緩和された。
  • 提案された最適化の修正(ターゲットエンコーディングの再定義)により、説明が関心の対象のオブジェクトに鋭く集中することが確認され、モデル設計と最適化が解釈性を共同で規定していることが裏付けられた。
  • B-cosフレームワークは、正則化層や非線形活性化関数がなくても、CIFAR-10で競争力ある性能を達成するB-cosオンリーのCNNとして実装可能であり、B-cos変換自体のモデル化能力を示している。
  • B-cos変換は、正則化層およびアテンション機構と互換性があり、解釈性や性能を損なわずに最先端のモデルに統合可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。