Skip to main content
QUICK REVIEW

[論文レビュー] High-contrast "gaudy" images improve the training of deep neural network models of visual cortex

Benjamin R. Cowley, Jonathan W. Pillow|arXiv (Cornell University)|Jun 13, 2020
Image Processing Techniques and Applications参考文献 59被引用数 4
ひとこと要約

本論文は、視覚皮質ニューロンの深層ニューラルネットワーク(DNN)リーダー・モデルのデータ効率的なトレーニング戦略として、『ゴージャス』画像——自然画像の高コントラストで二値化されたバージョン——を提案する。平均明度で二値化しきりを適用することで画素の分散を最大化し、ゴージャス画像はエッジや高コントラスト特徴を著しく強調する。これにより、高い予測精度に到達するためのトレーニング画像数を大幅に削減でき、一部のケースではアクティブラーニング手法でさえも上回る。

ABSTRACT

A key challenge in understanding the sensory transformations of the visual system is to obtain a highly predictive model of responses from visual cortical neurons. Deep neural networks (DNNs) provide a promising candidate for such a model. However, DNNs require orders of magnitude more training data than neuroscientists can collect from real neurons because experimental recording time is severely limited. This motivates us to find images that train highly-predictive DNNs with as little training data as possible. We propose gaudy images---high-contrast binarized versions of natural images---to efficiently train DNNs. In extensive simulation experiments, we find that training DNNs with gaudy images substantially reduces the number of training images needed to accurately predict the simulated responses of visual cortical neurons. We also find that gaudy images, chosen before training, outperform images chosen during training by active learning algorithms. Thus, gaudy images overemphasize features of natural images, especially edges, that are the most important for efficiently training DNNs. We believe gaudy images will aid in the modeling of visual cortical neurons, potentially opening new scientific questions about visual processing, as well as aid general practitioners that seek ways to improve the training of DNNs.

研究の動機と目的

  • 視覚皮質応答の正確な深層ニューラルネットワーク(DNN)モデルをトレーニングするために必要な実験的神経記録データ量を削減すること。
  • データが限られた状況下で、トレーニング中に情報量の増加を最大化する画像刺激を同定すること。
  • 事前に選択された、極めてコントラストの強い画像が、適応的でアクティブに学習された刺激を上回るかを検証すること。
  • ゴージャス画像が、ビジョンタスクにおけるデータ拡張およびトランスファーラーニングにどれほど有用かを評価すること。

提案手法

  • 自然画像の各カラー・チャンネルを二値化することでゴージャス画像を生成:画像の平均明度未満のピクセル強度を0、以上なら255に設定する。
  • ゴージャス画像を入力としてDNNリーダー・モデルをトレーニングし、シミュレートされた視覚皮質ニューロンの応答を予測することを目的とする。
  • 複数のDNNアーキテクチャおよび事前学習済みモデル(例:VGG19、ResNet-50)を用いて、ゴージャス画像とアクティブラーニング(例:プールベース、コアセット、アンサンブルベース)で選択された画像の性能を比較する。
  • バックプロパゲーションを用いて勾配を分析し、どの画像特徴(例:エッジ)がリーダー・ネットワークにおける最も情報量の多い更新を引き起こすかを特定する。
  • 通常画像とゴージャス画像のImageNet事前学習DNNにおけるトップ5分類予測を比較することで、データ拡張の可能性を評価する。
  • ゴージャス画像および通常画像セットの予測クラス確率を正規化することで、画像データセットのクラス不均衡を制御する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング前に生成されたゴージャス画像は、視覚皮質応答のDNNリーダー・モデルをトレーニングする際に、アクティブに選択された画像を上回るか?
  • RQ2ゴージャス画像は、DNNモデルで高い予測精度に到達するためのトレーニング画像数をどの程度削減できるか?
  • RQ3エッジやテクスチャなどのどの画像特徴がDNNリーダー・ネットワークのトレーニングに最も情報量が多いか?また、ゴージャス画像はそれらを過剰に強調しているか?
  • RQ4ゴージャス画像は、自然画像と構造的に類似しているため、オブジェクト認識タスクにおけるデータ拡張に適しているか?
  • RQ5事前学習済みDNNは、ゴージャス画像とそれに対応する自然画像に対して一貫した分類出力を維持するか?

主な発見

  • ゴージャス画像は、視覚皮質ニューロンのDNNリーダー・モデルをトレーニングする際に、高い予測精度に到達するためのトレーニング画像数を大幅に削減し、標準的な自然画像を著しく上回る。
  • ゴージャス画像は、シミュレートされたV4ニューロンの応答を予測する際に、アクティブラーニングアルゴリズムと同等またはそれ以上の性能を示し、トレーニング前に選択されているにもかかわらず。
  • トレーニングの向上をもたらす主な要因は、ゴージャス画像が高コントラストエッジを過剰に強調し、バックプロパゲーション中に大きな情報量を持つ勾配を生成することにある。
  • 複数の事前学習済みDNNを用いて、ゴージャス画像の少なくとも一部(p < 0.001)が自然画像と同一のトップ5分類予測を保持しており、データ拡張の有効性を示唆している。
  • 分類類似性において優れたパフォーマンスを示す一方で、ゴージャス画像は特定のクラス(例:400–1000)に予測クラス確率が集中する傾向があり、クラス固有の誤分類リスクがあることが示された。
  • 結果から、データが限られた状況下でゴージャス画像はDNNのトレーニングに特に効果的であり、神経科学およびビジョンアプリケーション分野において、アクティブラーニングの低コスト代替手段として強力である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。