Skip to main content
QUICK REVIEW

[論文レビュー] Exemplary Natural Images Explain CNN Activations Better than State-of-the-Art Feature Visualization

Judy Borowski, R. Zimmermann|arXiv (Cornell University)|Oct 23, 2020
Explainable Artificial Intelligence (XAI)被引用数 13
ひとこと要約

本研究は、Olahら(2017年)の合成特徴可視化と、同じ特徴を強く活性化する自然画像の例えを比較することで、CNN活性化の解釈可能性を評価する。制御された心理物理学実験により、人間の被験者が自然画像を参照にした場合、合成可視化(82±4%)よりも顕著に高い正確性(92±2%)で強く活性化する画像を特定できることを発見。これは、解釈可能性研究で広く用いられているにもかかわらず、実際の画像がはるかに優れていることを示している。

ABSTRACT

Feature visualizations such as synthetic maximally activating images are a widely used explanation method to better understand the information processing of convolutional neural networks (CNNs). At the same time, there are concerns that these visualizations might not accurately represent CNNs' inner workings. Here, we measure how much extremely activating images help humans to predict CNN activations. Using a well-controlled psychophysical paradigm, we compare the informativeness of synthetic images by Olah et al. (2017) with a simple baseline visualization, namely exemplary natural images that also strongly activate a specific feature map. Given either synthetic or natural reference images, human participants choose which of two query images leads to strong positive activation. The experiments are designed to maximize participants' performance, and are the first to probe intermediate instead of final layer representations. We find that synthetic images indeed provide helpful information about feature map activations ($82\\pm4\\%$ accuracy; chance would be $50\\%$). However, natural images - originally intended as a baseline - outperform synthetic images by a wide margin ($92\\pm2\\%$). Additionally, participants are faster and more confident for natural images, whereas subjective impressions about the interpretability of the feature visualizations are mixed. The higher informativeness of natural images holds across most layers, for both expert and lay participants as well as for hand- and randomly-picked feature visualizations. Even if only a single reference image is given, synthetic images provide less information than natural images ($65\\pm5\\%$ vs. $73\\pm4\\%$). In summary, synthetic images from a popular feature visualization method are significantly less informative for assessing CNN activations than natural images. We argue that visualization methods should improve over this baseline.

研究の動機と目的

  • CNN特徴マップの活性化を説明する際、合成特徴可視化と自然例え画像の情報量を評価すること。
  • Olahら(2017年)が提示した広く用いられている合成可視化が、CNNの挙動を人間が解釈するのに対して本当に効果的であるかを調査すること。
  • 元々単純なベースラインとして意図された自然画像が、専門家および一般ユーザーの両方にとって優れた解釈可能性を提供するかを評価すること。
  • 可視化タイプが人間の意思決定の正確性、反応時間、および予測の確信度に与える影響を測定すること。
  • 自然画像の利点が、異なるネットワーク層および手動選択・ランダム選択された特徴マップの両方で継続的に見られるかを特定すること。

提案手法

  • 人間被験者が、特定のCNN特徴マップでより強い活性化を示した画像を特定する2択分類タスクを実施した制御された心理物理学実験を実施。
  • 2種類の参照画像を用いた:Olahら(2017年)の合成された最大活性化画像と、同じ特徴マップを強く活性化する自然画像(ImageNet)。
  • タスクを最大限に性能向上させるために、曖昧さを最小限に抑え、クエリ画像間の活性化差を明確にした。
  • 専門家および一般被験者からの意思決定の正確性、反応時間、および確信度評価を収集。
  • ネットワークの複数の層と、手動選択およびランダム選択された特徴マップの両方で性能を評価。
  • 最小限の情報量を得るため、1つの参照画像のみを用いたアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1Olahら(2017年)の合成特徴可視化は、自然例え画像よりもCNN活性化をより効果的に説明できるか?
  • RQ2合成画像と自然画像を参照にした場合、人間被験者のCNN活性化予測性能はどのように異なるか?
  • RQ3自然画像の利点は、異なるネットワーク層および専門家・一般ユーザーの両方で成立するか?
  • RQ4合成可視化と自然画像を用いた場合、反応時間と確信度評価はどのように異なるか?
  • RQ51つの参照画像のみを提供した場合でも、自然画像による性能向上は依然として顕著か?

主な発見

  • 自然例え画像を参照にした被験者は92±2%の正確性で強く活性化する画像を特定したのに対し、合成可視化では82±4%にとどまり、有意に高い正確性を示した。
  • この性能格差は、中間層を含むすべてのネットワーク層で継続しており、自然画像の利点が深層または浅層の特徴に限定されないことを示している。
  • 自然画像を参照にした被験者は、反応が速く、より高い確信度を示しており、認知処理と解釈可能性の向上が示唆された。
  • 1つの参照画像のみを提示した場合でも、自然画像は73±4%の正確性を示したのに対し、合成画像は65±5%にとどまり、解釈可能性ツールとしての強靭性を示した。
  • 手動選択およびランダム選択された特徴マップの両方で、自然画像の優位性が維持されたため、合成可視化に対する一般化可能な利点が示された。
  • 主観的評価では、合成可視化の解釈可能性について混合した評価がなされた一方、自然画像は一貫してより意味的で直感的であると評価された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。