Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Learning of a Biologically-Inspired Visual Texture Model

Nikhil Parthasarathy, Eero P. Simoncelli|arXiv (Cornell University)|Jun 30, 2020
Advanced Image and Video Retrieval Techniques参考文献 70被引用数 4
ひとこと要約

本稿では、固定されたV1に類似したフィルタに続いて自己教師あり学習によるV2に類似した畳み込みフィルタを用いる、生物学的にインスパイドされた2段階の視覚的テクスチャモデル(V2Net)を提案する。このモデルは、低次元で不変なテクスチャ表現を生成する。新しい対照的目的関数を用いて、画像間の応答の相違度を最大化することで学習され、テクスチャ分類において優れたデータ効率性を達成するとともに、事前学習済みの深層畳み込みニューラルネットワーク(CNN)よりも、サルのV2神経応答に強い表現的類似性を示す。

ABSTRACT

We develop a model for representing visual texture in a low-dimensional feature space, along with a novel self-supervised learning objective that is used to train it on an unlabeled database of texture images. Inspired by the architecture of primate visual cortex, the model uses a first stage of oriented linear filters (corresponding to cortical area V1), consisting of both rectified units (simple cells) and pooled phase-invariant units (complex cells). These responses are processed by a second stage (analogous to cortical area V2) consisting of convolutional filters followed by half-wave rectification and pooling to generate V2 'complex cell' responses. The second stage filters are trained on a set of unlabeled homogeneous texture images, using a novel contrastive objective that maximizes the distance between the distribution of V2 responses to individual images and the distribution of responses across all images. When evaluated on texture classification, the trained model achieves substantially greater data-efficiency than a variety of deep hierarchical model architectures. Moreover, we show that the learned model exhibits stronger representational similarity to texture responses of neural populations recorded in primate V2 than pre-trained deep CNNs.

研究の動機と目的

  • サルのV1およびV2皮質処理を模倣する、低次元で生物学的にインスパイドされた視覚的テクスチャ表現モデルの開発を目的とする。
  • 新しい対照的目的関数を用いた自己教師あり学習を活用することで、テクスチャ分類におけるデータ効率の課題を解決することを目的とする。
  • 人工モデルとサルのV2における実際の神経集団応答との間の表現的類似性を向上させることを目的とし、特に中間視覚処理において重点を置く。
  • 非パラメトリックな対照的手法よりも生物学的に妥当性の高い、パラメトリックでオンライン学習可能な目的関数の探求を目的とする。
  • 早期および遅刻視覚領域に比べて不足している中間視覚領域(例:V2)の計算モデルのギャップを埋めることを目的とする。

提案手法

  • モデルは2段階のアーキテクチャを採用する:固定されたV1段階では、40個の方向性Gaborに類似したフィルタ(4方向 × 5スケール × 2位相)を用い、半波整流とL2プーリングによる複合細胞応答により60マップの特徴量を生成する。
  • V2段階は、V1出力を入力とするD=60の学習済み畳み込みフィルタから構成され、その後に半波整流と空間的L2プーリングが施され、V2に類似した複合細胞応答が得られる。
  • 新しい自己教師あり対照的目的関数が導入され、各画像のV2応答分布と、すべての画像にわたるグローバルな応答分布との間の距離を最大化する。
  • 目的関数はV2応答の平均および共分散統計量を用いてパラメトリック化されており、オンラインで逐次更新が可能であり、少数データ環境下での一般化性能が向上する。
  • 低次元特徴空間(60次元)と、二次変換に基づく非線形デコーダーを用いて、視覚系における階層的処理をモデル化する。
  • モデルは均一なテクスチャ画像のラベルなしデータセットで学習され、今後の展開として、局所的な空間的整合性制約を用いた自然シーンへの応用が計画されている。

実験結果

リサーチクエスチョン

  • RQ1固定されたV1と学習済みのV2フィルタを有する生物学的にインスパイドされた2段階モデルは、テクスチャ分類において高いデータ効率を達成できるか?
  • RQ2応答分布統計量に基づく自己教師あり対照的目的関数は、少数データ環境下での表現学習を改善するか?
  • RQ3学習されたモデルの表現は、実際のサルV2ニューロンの応答パターンにどれほど近いか?
  • RQ4低次元で解釈可能なモデルは、生物学的神経集団応答との表現的類似性において、深層CNNを上回ることができるか?
  • RQ5階層的視覚表現学習において、非パラメトリックな対照的手法よりも、パラメトリックでオンライン学習可能な目的関数は生物学的に妥当性が高いとされるか?

主な発見

  • V2Netモデルは、60次元という低次元特徴空間であるにもかかわらず、さまざまな深層階層的アーキテクチャよりも顕著に高いデータ効率性を示す。
  • 事前学習済みの深層畳み込みニューラルネットワークよりも、実際のサルV2神経集団応答との間で顕著に強い表現的類似性を示す。
  • 平均および共分散統計量を用いて画像間の応答相違度を最大化する、新しい対照的学習目的関数が、少数データでの高い性能を達成するために不可欠であった。
  • V2段階への単純細胞および複合細胞応答の両方の入力を組み込むことで、より強固なテクスチャ表現の学習に機能的利点が得られる。
  • モデルのパラメトリックでオンライン学習可能な目的関数により、全グローバルデータ分布を保存せずに生物学的に妥当な逐次的更新が可能である。
  • 応答空間における空間的整合性を課すことで、階層的モデルや自然シーン学習への応用への可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。