[論文レビュー] Deeper Interpretability of Deep Networks
本稿では、3次元顔生成モデルを用いて内在的および外在的要因の変動を制御することで、畳み込みニューラルネットワーク(CNN)の表現を解釈するための情報理論的で新規な手法を提案する。一般化相互情報量(GCMI)および再冗長性測度を隠れ層の活性化に適用することで、ネットワークが形状変形に対して顔の識別を過剰に一般化しているが、テクスチャの変化に対しては非常に感受的であることが明らかになった。特に中位層の特徴の一部が最終分類に診断的であることが示された。
Deep Convolutional Neural Networks (CNNs) have been one of the most influential recent developments in computer vision, particularly for categorization. There is an increasing demand for explainable AI as these systems are deployed in the real world. However, understanding the information represented and processed in CNNs remains in most cases challenging. Within this paper, we explore the use of new information theoretic techniques developed in the field of neuroscience to enable novel understanding of how a CNN represents information. We trained a 10-layer ResNet architecture to identify 2,000 face identities from 26M images generated using a rigorously controlled 3D face rendering model that produced variations of intrinsic (i.e. face morphology, gender, age, expression and ethnicity) and extrinsic factors (i.e. 3D pose, illumination, scale and 2D translation). With our methodology, we demonstrate that unlike human's network overgeneralizes face identities even with extreme changes of face shape, but it is more sensitive to changes of texture. To understand the processing of information underlying these counterintuitive properties, we visualize the features of shape and texture that the network processes to identify faces. Then, we shed a light into the inner workings of the black box and reveal how hidden layers represent these features and whether the representations are invariant to pose. We hope that our methodology will provide an additional valuable tool for interpretability of CNNs.
研究の動機と目的
- 生成的3次元顔モデルにおける刺激の変動を制御することで、CNNのより深い解釈性フレームワークを構築すること。
- 特に顔の識別分類に関して、階層的層を通過する間、深層ネットワークが視覚的情報をどのように表現・変換するかを理解すること。
- 10層のResNetにおいて、最終分類意思決定にどの特徴(形状対テクスチャ)が診断的であるかを特定すること。
- 情報理論的測度を用いて、隠れ層における視点依存的表現と視点不変表現を分離すること。
- 情報の流れと変換を定量化することで、CNNが脳に類似した視覚処理の解釈可能なモデルとして機能できるようにすること。
提案手法
- 内在的要因(顔の識別、年齢、性別、民族、表情)および外在的要因(姿勢、照明、スケール、平行移動)を制御した2600万枚の3次元レンダリング顔画像で、10層のResNetを学習した。
- 生成的次元(形状頂点およびテクスチャピクセル)にターゲットを置いた多次元ノイズを適用し、ネットワークの反応を調べた。
- 一般化相互情報量(GCMI)を用いて、隠れ層9.5に表現されている、入力サンプルおよび出力意思決定と相関する特徴を同定した。
- 再冗長性(Red)を測度として用い、層9.5と最終出力意思決定の両方に共に表現されている特徴のサブセットを隔離することで、診断的特徴を特定した。
- 再冗長性を形式的に定義した:Red(S;L;R) = MI(S;L) + MI(S;R) - MI(S;R,L)、ここでSは入力サンプル、Lは層応答、Rは出力意思決定を表す。
- 層9.5の最も再冗長性の高い主成分(PC)を顔再構築に投影することで、診断的特徴を非診断的特徴から可視化した。
実験結果
リサーチクエスチョン
- RQ1顔の識別認識中に、深層CNNは階層的層を通過する際、形状およびテクスチャ特徴をどのように表現しているか?
- RQ2CNNは、人間の知覚と比較して、形状の変化に対して顔の識別をどの程度過剰に一般化しているか?
- RQ3隠れ層内のどの特定の特徴が最終分類に実際に使用されており、非診断的表現からどのように隔離できるか?
- RQ4視点依存的表現と視点不変表現が、同じ隠れ層にどのように共存しているか?
- RQ5再冗長性のような情報理論的測度は、深層ネットワーク表現における診断的特徴と非診断的特徴を効果的に分離できるか?
主な発見
- ネットワークは顔の形状の変化、性別、年齢、表情の変化など極端な形状変形に対してほとんど不変であったため、顔の識別が過剰に一般化されていることが示された。
- 一方で、ネットワークはテクスチャの変化に対して非常に感受的であり、顔の識別にテクスチャ特徴が支配的であることが判明したが、これは顔の識別がほとんど変化していないにもかかわらずである。
- 層9.5の特徴のわずかなサブセット(アイデンティティワンでは形状のPC2およびテクスチャのPC1、アイデンティティツーでは形状のPC2およびテクスチャのPC3)のみが最終出力と再冗長性を示しており、診断的関連性があることが示された。
- 再冗長性解析により、層9.5に表現されている広範な特徴のうち、診断的特徴が明確に隔離された。これは、表現と意思決定の間の明確な分離を示している。
- 本研究では、ネットワーク内の形状特徴が主に視点依存的であるのに対し、テクスチャ特徴はより視点不変的であることが判明した。これは人間の知覚とは観察されないパターンである。
- 本研究で提案された手法により、入力から隠れ層、出力への情報の流れを定量化することで、深層ネットワークにおける特徴選択と変換の分析フレームワークが可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。