Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Information Flow Through Deep Neural Networks

Ahmad Chaddad, Behnaz Naisiri|arXiv (Cornell University)|Nov 29, 2017
Domain Adaptation and Few-Shot Learning参考文献 30被引用数 3
ひとこと要約

本論文は、畳み込みフィルタ応答Yの条件付きエントロピーH(Y|C,F)を計算することにより、深層畳み込みニューラルネットワークにおける情報フローをモデル化する、情報理論的枠組みである条件付きエントロピーニューラル活性化(CENT)を導入する。訓練済みのCNNから得られるCENT特徴量は、極めて少ないパラメータで最先端の性能を達成し、アルツハイマー病の分類(AUC=94.6%)および転移学習(1000特徴量のソフトマックス出力と同等のAUC)において、元のCNNのソフトマックス出力よりも優れている。

ABSTRACT

This paper proposes a principled information theoretic analysis of classification for deep neural network structures, e.g. convolutional neural networks (CNN). The output of convolutional filters is modeled as a random variable Y conditioned on the object class C and network filter bank F. The conditional entropy (CENT) H(Y |C,F) is shown in theory and experiments to be a highly compact and class-informative code, that can be computed from the filter outputs throughout an existing CNN and used to obtain higher classification results than the original CNN itself. Experiments demonstrate the effectiveness of CENT feature analysis in two separate CNN classification contexts. 1) In the classification of neurodegeneration due to Alzheimer's disease (AD) and natural aging from 3D magnetic resonance image (MRI) volumes, 3 CENT features result in an AUC=94.6% for whole-brain AD classification, the highest reported accuracy on the public OASIS dataset used and 12% higher than the softmax output of the original CNN trained for the task. 2) In the context of visual object classification from 2D photographs, transfer learning based on a small set of CENT features identified throughout an existing CNN leads to AUC values comparable to the 1000-feature softmax output of the original network when classifying previously unseen object categories. The general information theoretical analysis explains various recent CNN design successes, e.g. densely connected CNN architectures, and provides insights for future research directions in deep learning.

研究の動機と目的

  • 深層ニューラルネットワークにおける情報フローを分析する原理的で情報理論的な枠組みを開発すること。
  • 残差接続や密接続ネットワークといったヒューリスティックなCNN設計改善の背後にある統一的理論的理解の欠如に応えること。
  • 標準的な出力表現(例:ソフトマックス)よりも優れた、クラスに情報的な特徴を訓練済みのCNNから特定すること。
  • 再訓練を伴わずに、既存のCNNから抽出した少数の特徴量を用いて、効果的な転移学習を可能にすること。

提案手法

  • 物体クラスCおよびフィルタバンクFに条件付けられた畳み込みフィルタ出力を確率変数Yとしてモデル化する。
  • 情報含量の指標として条件付きエントロピーH(Y|C,F)を計算し、これをCENT特徴量と呼ぶ。
  • CENT特徴量を画像分類のためのコン act で、クラス判別力のあるコードとして、従来のCNN出力の置き換えや補完に用いる。
  • CENT特徴量を用いてランダムフォレスト分類器を適用し、疾患分類および転移学習における性能を評価する。
  • 複数の畳み込み層にわたる層ごとのCENT計算を実施し、ネットワークの異なる深さからの情報を統合する。
  • アブレーションおよび転移学習の設定において、CENTの性能を元のCNNのソフトマックス出力と比較する。

実験結果

リサーチクエスチョン

  • RQ1フィルタ応答の条件付きエントロピーH(Y|C,F)は、深層ネットワークにおける画像分類のための、情報量が多くかつコンパクトなコードとして機能できるか?
  • RQ2CENT特徴量抽出は、ソフトマックスのような標準的なCNN出力よりも分類性能を向上させるか?
  • RQ3少数のCENT特徴量を用いて、以前に見られなかった物体カテゴリのための効果的な転移学習が可能か?
  • RQ4情報理論的枠組みは、密接続ネットワークのような現代のCNNアーキテクチャの成功をどのように説明できるか?
  • RQ5ReLU正規化の影響は、CENT特徴量の品質および分類性能にどのように現れるか?

主な発見

  • 3つの畳み込み層からのCENT特徴量のみで、OASISデータセットの3次元MRIスキャンを用いたアルツハイマー病分類においてAUC 94.6%を達成し、元のCNNのソフトマックス出力よりも12%優れていた。
  • 転移学習において、事前学習済みCNNから抽出した少数のCENT特徴量が、10の新しい物体カテゴリを分類する際、1000特徴量のソフトマックス層と同等のAUC値を達成した。
  • ReLU正規化後にCENTを計算した場合、CENT特徴量の性能が顕著に向上した。これは、正規化され、二峰性でない応答が、クラス判別力の向上に寄与していることを示唆している。
  • ランダムフォレストモデルが選択したCENT特徴量は、より深いネットワーク層のフィルタに対応しており、高レベルの表現が分類に最も情報を与えていることを示している。
  • 本フレームワークは、情報統合が層間で促進されることで分類性能が向上することを示しており、密接続ネットワークのような現代的アーキテクチャの成功を説明している。
  • N個の物体クラスを一意に符号化するには、最低でもlog₂N個のCENT特徴量が必要であるという理論的根拠が示唆されており、CNNスケーリングの根拠を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。