Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchically Compositional Tasks and Deep Convolutional Networks

Arturo Deza, Qianli Liao|arXiv (Cornell University)|Jun 24, 2020
Domain Adaptation and Few-Shot Learning参考文献 89被引用数 4
ひとこと要約

この論文は、深層畳み込みニューラルネットワーク(DCNs)が特定の視覚的タスクで全結合ネットワークを上回る理由を、関数における階層的構成的構造の役割に注目して調査する。局所的画像構造を破壊する決定論的スクラムブルを用いて、DCNは階層的局所性を有するタスク(例:物体認識)において優れた性能を示すが、全般的な色推定のような非構成的タスクでは浅い全結合ネットワークが優れていることが示され、アーキテクチャの誘導的バイアスがタスクの関数的構造と一致する必要があることが明らかになった。

ABSTRACT

The main success stories of deep learning, starting with ImageNet, depend on deep convolutional networks, which on certain tasks perform significantly better than traditional shallow classifiers, such as support vector machines, and also better than deep fully connected networks; but what is so special about deep convolutional networks? Recent results in approximation theory proved an exponential advantage of deep convolutional networks with or without shared weights in approximating functions with hierarchical locality in their compositional structure. More recently, the hierarchical structure was proved to be hard to learn from data, suggesting that it is a powerful prior embedded in the architecture of the network. These mathematical results, however, do not say which real-life tasks correspond to input-output functions with hierarchical locality. To evaluate this, we consider a set of visual tasks where we disrupt the local organization of images via "deterministic scrambling" to later perform a visual task on these images structurally-altered in the same way for training and testing. For object recognition we find, as expected, that scrambling does not affect the performance of shallow or deep fully connected networks contrary to the out-performance of convolutional networks. Not all tasks involving images are however affected. Texture perception and global color estimation are much less sensitive to deterministic scrambling showing that the underlying functions corresponding to these tasks are not hierarchically local; and also counter-intuitively showing that these tasks are better approximated by networks that are not deep (texture) nor convolutional (color). Altogether, these results shed light into the importance of matching a network architecture with its embedded prior of the task to be learned.

研究の動機と目的

  • 階層的局所性を有する関数に対応する現実世界の視覚的タスクを特定すること。これは、深層畳み込みニューラルネットワークが示す指数的近似優位性を可能にする主要な構造的性質である。
  • 物体認識における深層畳み込みニューラルネットワークの成功が、階層的構成性へのアーキテクチャ的誘導的バイアスに起因するかどうかを評価すること。
  • 階層的構造を欠くタスク(例:全般的な色推定やテクスチャ認識)は、非畳み込み的または浅いアーキテクチャによってよりよく近似可能であるという仮説を検証すること。
  • 決定論的スクラムブルによる画像構造の破壊を通じて、深層畳み込みニューラルネットワークの限界を調査し、アーキテクチャ間でのパフォーマンスの変化を測定すること。
  • 近似理論からの理論的結果を実証的に検証することにより、DCNが万能的ではないこと、タスク固有の関数的構造に依存することを示すこと。

提案手法

  • 画像の局所的空間的整列性を破壊するため、決定論的スクラムブルを適用し、トレーニングおよびテストの両方で構造的一致性を保持した。
  • 同じタスク上で、深層畳み込みニューラルネットワーク(例:ThreeConvNet、VGG11)、浅い全結合ネットワーク(SFCN)、広い全結合ネットワーク(Wide-Net)、深層全結合ネットワーク(Deep-Net)の3つのアーキテクチャをトレーニングおよび評価した。
  • グローバル色推定タスクで平均二乗誤差(MSE)損失を用いてネットワークを訓練し、さまざまなスクラムブルレベルにおける近似誤差を測定した。
  • 画像スクラムブルの度合いを変化させた条件下で、アーキテクチャ間のパフォーマンスを比較し、局所的構造の喪失に対する感受性を評価した。
  • 特に階層的局所関数に対する深層畳み込みニューラルネットワークの指数的パrameter効率性に着目した近似理論の結果を、実験設計のフレームワークに活用した。
  • CIFAR-100データセットを用い、物体認識および色推定タスクを実施。トレーニングおよびテストの両方で、元の画像とスクラムブル済み画像を用いた。

実験結果

リサーチクエスチョン

  • RQ1どの視覚的タスクが本質的に階層的構成的であり、深層畳み込みニューラルネットワークの誘導的バイアスに恩恵を受けるのか?
  • RQ2画像構造の決定論的スクラムブルが、異なる視覚的タスクにおける深層畳み込みニューラルネットワークと全結合ネットワークのパフォーマンスにどのように影響するのか?
  • RQ3階層的局所性を欠くタスク(例:全般的な色推定やテクスチャ認識)は、非畳み込み的または浅いアーキテクチャによってよりよく近似可能なのか?
  • RQ4ネットワークのアーキテクチャ的誘導的バイアスが、ターゲットタスクの関数的構造とどの程度一致しているのか?
  • RQ5階層的局所関数を近似する際の深層畳み込みニューラルネットワークの理論的優位性が、制御された画像操作を通じて実証的に検証可能か?

主な発見

  • 深層畳み込みニューラルネットワークは、決定論的スクラムブル後でも物体認識タスクで浅い全結合ネットワークを顕著に上回り、階層的局所性に依存していることが確認された。
  • 浅い全結合ネットワークは、深層畳み込みニューラルネットワークよりもグローバル色推定で低い平均二乗誤差を達成しており、色推定が階層的構成的でないことが示され、単純なアーキテクチャがより適していることがわかった。
  • 広い全結合ネットワークは、深層全結合ネットワークおよび深層畳み込みニューラルネットワークを上回る性能を示し、非畳み込みアーキテクチャの能力が向上することで、グローバルで非構成的関数をよりよく近似できることが示唆された。
  • 画像スクラムブルによって局所的構造が消失すると、深層畳み込みニューラルネットワークのパフォーマンスは浅い全結合ネットワークの水準に漸近的に近づく。これは、DCNが局所性を無いかつても利用を試み続けていることを示している。
  • ThreeConvNetはテクスチャ認識では高い性能を示すが、色推定では全結合ネットワークに劣る。これは、畳み込みの誘導的バイアスがグローバルで非局所的タスクには最適でないことを確認している。
  • 理論的主張である『深層畳み込みニューラルネットワークは、階層的局所関数に対して指数的近似優位性を持つ』という仮説が、制御された画像操作を通じて実証的に検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。