Skip to main content
QUICK REVIEW

[論文レビュー] Learning Efficient Coding of Natural Images with Maximum Manifold Capacity Representations

Thomas Yerxa, Yilun Kuang|arXiv (Cornell University)|Mar 6, 2023
Neural dynamics and brain function被引用数 5
ひとこと要約

本論文は、低次元多様体における分離可能なオブジェクトカテゴリの数を最大化することにより、高い符号化効率を最適化する、新しい自己教師あり学習手法であるMaximum Manifold Capacity Representations (MMCR)を提案する。計算的に高コストな多様体容量測定を微分可能関数に再定式化することで、MMCRはImageNet-1Kで8視点を使用した場合に72.1%のトップ-1線形評価精度を達成し、SOTA水準の性能を示した。また、オブジェクト検出においてもAP50 = 81.9の高い性能を発揮し、サルの腹側ストリーム反応をモデル化する上で生物学的妥当性を示した。

ABSTRACT

The efficient coding hypothesis proposes that the response properties of sensory systems are adapted to the statistics of their inputs such that they capture maximal information about the environment, subject to biological constraints. While elegant, information theoretic properties are notoriously difficult to measure in practical settings or to employ as objective functions in optimization. This difficulty has necessitated that computational models designed to test the hypothesis employ several different information metrics ranging from approximations and lower bounds to proxy measures like reconstruction error. Recent theoretical advances have characterized a novel and ecologically relevant efficiency metric, the manifold capacity, which is the number of object categories that may be represented in a linearly separable fashion. However, calculating manifold capacity is a computationally intensive iterative procedure that until now has precluded its use as an objective. Here we outline the simplifying assumptions that allow manifold capacity to be optimized directly, yielding Maximum Manifold Capacity Representations (MMCR). The resulting method is closely related to and inspired by advances in the field of self supervised learning (SSL), and we demonstrate that MMCRs are competitive with state of the art results on standard SSL benchmarks. Empirical analyses reveal differences between MMCRs and representations learned by other SSL frameworks, and suggest a mechanism by which manifold compression gives rise to class separability. Finally we evaluate a set of SSL methods on a suite of neural predictivity benchmarks, and find MMCRs are higly competitive as models of the ventral stream.

研究の動機と目的

  • 多様体容量測定を微分可能で最適化に適した関数に再定式化し、自己教師あり学習の目的関数として用いること。
  • 同じオブジェクトのビューをコンactに表現しつつ、異なるオブジェクトクラスを分離するMaximum Manifold Capacity Representations (MMCR)を学習すること。
  • 線形評価およびオブジェクト検出を含む、標準的な自己教師あり学習ベンチマークにおけるMMCRの性能を評価すること。
  • MMCRの生物学的妥当性を、サルの腹側ストリームにおける神経応答と比較することで評価すること。
  • 多様体圧縮が非教師あり表現におけるクラス分離性をどのように向上させるかのメカニズムを解明すること。

提案手法

  • 重心行列の特異値分解(SVD)を用いて、元来評価にのみ使われていた多様体容量測定を微分可能関数に再定式化する。
  • 対照学習を用いてResNet-50エンコーダーを訓練し、プロジェクターヘッドを備える。目的関数は、線形で分離可能なオブジェクトカテゴリの数を最大化することを目的とする。
  • 同じ画像の複数のビューをポジティブペアとして用い、訓練の安定化のためモーメンタムエンコーダーを導入する。
  • 線形評価プロトコルを適用:特徴量を固定した上で線形分類器を学習し、表現の質を評価する。
  • VOC07+12でFaster R-CNNとC-4バックボーンを用いてオブジェクト検出のファインチューニングを実施し、転移性能をテストする。
  • MMCRの表現をマカクの視覚皮質からの神経データと比較し、生物学的妥当性を評価する。

実験結果

リサーチクエスチョン

  • RQ1再定式化された多様体容量測定は、自己教師あり表現学習の有効で微分可能な目的関数として利用可能か?
  • RQ2MMCRは、線形評価精度および転移性能の観点で、SOTAの自己教師あり手法と比較してどのように差をつけるか?
  • RQ3多様体圧縮が非教師あり表現におけるクラス分離性を向上させるメカニズムは何か?
  • RQ4MMCRの表現は、サルの腹側ストリームにおける神経応答をどの程度正確に予測できるか?
  • RQ5より長い事前学習はMMCRの性能を向上させるか?また、視点数の増加に伴い性能はどのようにスケーリングするか?

主な発見

  • MMCRは8視点を使用したImageNet-1Kでトップ-1線形評価精度72.1%を達成し、SimCLR や MoCo v2 などのSOTA手法と同等またはそれを上回った。
  • 2視点で1000エポックの事前学習を実施した場合、MMCRはトップ-1精度73.0%を達成し、SimCLR(69.3%)およびMoCo v2(71.1%)を上回った。
  • VOC07+12オブジェクト検出ベンチマークでは、MMCRはAP50 = 81.9を達成し、MoCo v2(82.4)と同等の性能を示した。ReLICv2(77.1% mAP)などのSOTA手法とも比較的近い性能を発揮した。
  • モーメンタムエンコーダーの導入により、特に視点数が少ない場合にわずかだが一貫した性能向上が見られ、ポジティブペアの多様性が向上したと示唆された。
  • MMCRの表現は強力な神経予測性を示し、サルの腹側ストリーム神経応答ベンチマークのスイートにおいて良好な性能を発揮した。
  • スペクトル解析により、MMCRの表現は固有値に1に近い係数のべき乗則減衰を示しており、一般化性能および生物学的妥当性と関連する特徴を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。