Skip to main content
QUICK REVIEW

[論文レビュー] Basic Level Categorization Facilitates Visual Object Recognition

Panqu Wang, Garrison W. Cottrell|arXiv (Cornell University)|Nov 12, 2015
Face Recognition and Perception参考文献 49被引用数 8
ひとこと要約

この論文は、人間の視覚発達にインspiredされた2段階訓練戦略を、深層畳み込みニューラルネットワーク(CNNs)に提案する。まず、基本レベルのオブジェクトカテゴリ(例:'dog'、'car')で事前学習を行い、その後、下位レベルのタスク(例:特定の品種)で微調整する。脳の仮説された上位から下位への促進効果(基本レベルの処理から生じる)を活用することで、一般化性能と性能が向上し、ImageNet ILSVRC 2012でトップ5正解率82.14%を達成(前回80.13%)し、より小さなデータセットでも優れた転移学習性能を示した。

ABSTRACT

Recent advances in deep learning have led to significant progress in the computer vision field, especially for visual object recognition tasks. The features useful for object classification are learned by feed-forward deep convolutional neural networks (CNNs) automatically, and they are shown to be able to predict and decode neural representations in the ventral visual pathway of humans and monkeys. However, despite the huge amount of work on optimizing CNNs, there has not been much research focused on linking CNNs with guiding principles from the human visual cortex. In this work, we propose a network optimization strategy inspired by both of the developmental trajectory of children's visual object recognition capabilities, and Bar (2003), who hypothesized that basic level information is carried in the fast magnocellular pathway through the prefrontal cortex (PFC) and then projected back to inferior temporal cortex (IT), where subordinate level categorization is achieved. We instantiate this idea by training a deep CNN to perform basic level object categorization first, and then train it on subordinate level categorization. We apply this idea to training AlexNet (Krizhevsky et al., 2012) on the ILSVRC 2012 dataset and show that the top-5 accuracy increases from 80.13% to 82.14%, demonstrating the effectiveness of the method. We also show that subsequent transfer learning on smaller datasets gives superior results.

研究の動機と目的

  • 基本レベルのオブジェクトカテゴリで事前学習することで、視覚的オブジェクト認識のための深層CNNの性能が向上するかどうかを調査すること。
  • 前頭前皮質(PFC)から下頭側頭皮質(IT)皮質への、高速なマグノセルラル経路を介した、脳の仮説された上位から下位への促進効果をモデル化すること。
  • 子供のオブジェクト分類の発達的経路が、より良いディープラーニングの訓練戦略を示唆するかどうかを調査すること。
  • 下位レベル分類のための正則化誘導的バイアスとして、基本レベル事前学習の有効性を評価すること。
  • 2段階訓練アプローチを用いることで、より小さなデータセットでの転移学習性能が向上することを示すこと。

提案手法

  • 著者らは、ImageNetの階層構造(synsetツリー構造)を用いて、広いオブジェクトタイプ(例:'dog'、'car'、'fruit')を表す308のカテゴリを抽出した。
  • 深層CNN(AlexNet)を、これらの308の基本レベルカテゴリでImageNetデータセットを用いて最初に学習させた。
  • 事前学習後、同じネットワークを1000クラス分類タスク(ILSVRC 2012の下位レベル分類)で微調整した。
  • この方法は、基本レベルの表現が、下位レベル学習におけるより良い一般化を促進する初期の「推測」または事前知識として機能することを活用している。
  • トップ5正解率(ImageNet)とCaltechデータセットにおける転移学習性能を用いて評価した。
  • 標準的な訓練法と他の事前学習ベースラインとを比較することで、基本レベル事前学習の影響を隔離した。

実験結果

リサーチクエスチョン

  • RQ1基本レベルのオブジェクトカテゴリで事前学習することで、下位レベル画像分類タスクにおける深層CNNの性能が向上するか?
  • RQ2基本レベル認識が下位レベル認識よりも先に発現する人間のオブジェクト分類の発達的経路が、より良いディープラーニングの訓練戦略を示唆するか?
  • RQ3Bar(2003)が提唱した、PFCとマグノセルラル経路を介した上位から下位への促進メカニズムが、ディープネットワークにモデル化された場合に、実証的に有益であるか?
  • RQ4基本レベル事前学習が、より小さな下流データセットにおける転移学習性能を向上させるか?
  • RQ5性能向上は、事前学習そのものに起因するのか、それとも、ターゲットタスクで継続的な学習が必要なのか?

主な発見

  • 308の基本レベルカテゴリで事前学習し、その後1000クラス分類タスク(ILSVRC 2012)で微調整する2段階訓練戦略により、トップ5正解率が80.13%から82.14%に向上した。
  • その後、ターゲットタスクで微調整を行わない場合、基本レベルカテゴリでの事前学習だけでは性能向上が確認されず、ターゲットタスクでの継続的学習が不可欠であることが示された。
  • 標準的な訓練ベースラインと比較して、事前学習ネットワークはCaltechデータセットで優れた転移学習性能を示し、一般化性能の向上が裏付けられた。
  • 結果から、基本レベル事前学習が、下位レベルタスクの最適化のための最適化のしやすさを向上させる正則化誘導的バイアスとして機能することが示唆された。
  • 性能向上は、基本レベルの表現から得られる有用な事前知識が、より具体的な特徴の学習をガイドするためのものであると解釈される。
  • 著者らの知る限り、本研究は、発達的および神経生物学的原則に基づいて、深層CNNにおける基本レベル促進効果をモデル化した最初の研究である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。