Skip to main content
QUICK REVIEW

[論文レビュー] DHOG: Deep Hierarchical Object Grouping

Luke Nicholas Darlow, Amos Storkey|arXiv (Cornell University)|Mar 13, 2020
Advanced Neural Network Applications参考文献 29被引用数 5
ひとこと要約

DHOGは、複数のニューラルネットワークヘッドを段階的に訓練することで、相互情報量の最小化によって各ヘッドが相違性のある、重複のない表現を学習するように促す、深層階層的表現学習フレームワークを提案する。この階層的アプローチにより、相互情報量最大化における局所最適解を回避し、Sobelエッジ検出などの前処理を用いないCIFAR-10(+4.3%)、CIFAR-100-20(+1.5%)、SVHN(+7.2%)で最先端の結果を達成した。

ABSTRACT

Recently, a number of competitive methods have tackled unsupervised representation learning by maximising the mutual information between the representations produced from augmentations. The resulting representations are then invariant to stochastic augmentation strategies, and can be used for downstream tasks such as clustering or classification. Yet data augmentations preserve many properties of an image and so there is potential for a suboptimal choice of representation that relies on matching easy-to-find features in the data. We demonstrate that greedy or local methods of maximising mutual information (such as stochastic gradient optimisation) discover local optima of the mutual information criterion; the resulting representations are also less-ideally suited to complex downstream tasks. Earlier work has not specifically identified or addressed this issue. We introduce deep hierarchical object grouping (DHOG) that computes a number of distinct discrete representations of images in a hierarchical order, eventually generating representations that better optimise the mutual information objective. We also find that these representations align better with the downstream task of grouping into underlying object classes. We tested DHOG on unsupervised clustering, which is a natural downstream test as the target representation is a discrete labelling of the data. We achieved new state-of-the-art results on the three main benchmarks without any prefiltering or Sobel-edge detection that proved necessary for many previous methods to work. We obtain accuracy improvements of: 4.3% on CIFAR-10, 1.5% on CIFAR-100-20, and 7.2% on SVHN.

研究の動機と目的

  • グリーディな最適化と限界的なデータ拡張による、自己教師あり表現学習における相互情報量最大化の性能劣化を是正すること。
  • 確率的勾配降下法が単純な特徴(例:平均色)に依存する容易な局所最適解に収束する傾向を克服すること。
  • 連続するネットワークヘッド間の相互情報量を最小化することで、多様で階層的な表現を促進する手法を開発すること。
  • Sobelエッジ検出などの前処理技術に依存せずに、下流のクラスタリング性能を向上させること。
  • 階層的な表現の順序付けが、潜在的なオブジェクトクラスとより良い一致を示し、拡張されたビュー間の相互情報量を高めることを示すこと。

提案手法

  • DHOGは、単純な表現からより複雑な表現へと段階的に順序付けられた、複数のニューラルネットワークヘッドを訓練する。
  • 各ヘッドは、対照的学習と同様に、同じ画像の拡張ビュー間の相互情報量を最大化する。
  • 連続するヘッド間の冗長性を低減するために、ヘッド間の相互情報量最小化項を導入し、後続のヘッドが特徴を独自に学習するように強制する。
  • i < j である第iおよび第jヘッド間の相互情報量を、対照的損失を用いて最小化することで、一意な表現を促進する。
  • 訓練目的関数は、各ヘッドにおける拡張ベースの相互情報量最大化と、ヘッド間の相互情報量最小化を組み合わせ、多様性を促進する。
  • 階層的構造により、初期のヘッドは単純な低レベル特徴を学習し、後続のヘッドはより複雑な高レベル表現を発見するよう強制される。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークヘッドの階層的訓練順序は、自己教師あり表現学習における相互情報量最大化を改善できるか?
  • RQ2連続するヘッド間の相互情報量を最小化することで、モデルが同じ局所最適解に収束するのを防げるか?
  • RQ3Sobelエッジ検出などの前処理を用いないにもかかわらず、このアプローチは既存の最先端手法を上回るクラスタリング性能を達成できるか?
  • RQ4初期ヘッドと後続ヘッドの学習済み表現は、特徴の複雑さとクラスタの明確さの観点でどのように異なるか?
  • RQ5階層的構造は、ベンチマークデータセットにおける潜在的なオブジェクトクラスとの一致をどの程度向上させるか?

主な発見

  • DHOGは、自己教師ありクラスタリングにおいて、先行する最先端手法と比較してCIFAR-10で4.3%の精度向上を達成した。
  • CIFAR-100-20では、Sobelエッジ検出や事前フィルタリングを用いない状態で1.5%のクラスタリング精度向上を達成した。
  • SVHNでは7.2%の精度向上を達成し、多様なデータセットにわたる優れた一般化性能を示した。
  • CIFAR-10ではA/4.2%の向上が観察されたが、論文の結論では4.3%として全結果が報告された。
  • t-SNE可視化では、階層の上位へ進むにつれて表現が次第に明確に分離し、クラスタに類似した形状を示した。後続のヘッドはより複雑なオブジェクトレベルの特徴を捉えていた。
  • 混同行列の結果、相互情報量最小化を考慮しないモデルと比較して、最終的なDHOGヘッドでは顕著に少ないクラス間の混同が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。