Skip to main content
QUICK REVIEW

[論文レビュー] On the surprising similarities between supervised and self-supervised models

Robert Geirhos, Kantharaju Narayanappa|arXiv (Cornell University)|Oct 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 24被引用数 19
ひとこと要約

本研究では、130,000回の試行にわたる15の一般化データセットを通じて、自己教師ありと教師ありの深層学習モデルを人間の心理物理学的データと比較した。訓練目的が異なっても、自己教師ありモデルは教師ありモデルと顕著に類似した行動パターンを示すことが判明した。特に、ノイズ耐性が低い(SimCLRを除く)、人間とは異なる誤りパターン、強いテクスチャバイアスが顕著である。これは、現在の自己教師ありアプローチが、人間のような視覚認識をまだ再現していないことを示唆している。

ABSTRACT

How do humans learn to acquire a powerful, flexible and robust representation of objects? While much of this process remains unknown, it is clear that humans do not require millions of object labels. Excitingly, recent algorithmic advancements in self-supervised learning now enable convolutional neural networks (CNNs) to learn useful visual object representations without supervised labels, too. In the light of this recent breakthrough, we here compare self-supervised networks to supervised models and human behaviour. We tested models on 15 generalisation datasets for which large-scale human behavioural data is available (130K highly controlled psychophysical trials). Surprisingly, current self-supervised CNNs share four key characteristics of their supervised counterparts: (1.) relatively poor noise robustness (with the notable exception of SimCLR), (2.) non-human category-level error patterns, (3.) non-human image-level error patterns (yet high similarity to supervised model errors) and (4.) a bias towards texture. Taken together, these results suggest that the strategies learned through today's supervised and self-supervised training objectives end up being surprisingly similar, but distant from human-like behaviour. That being said, we are clearly just at the beginning of what could be called a self-supervised revolution of machine vision, and we are hopeful that future self-supervised models behave differently from supervised ones, and---perhaps---more similar to robust human object recognition.

研究の動機と目的

  • 自己教師ありモデルが視覚認識タスクにおいて、教師ありモデルよりも人間に近い行動を示すかどうかを調査すること。
  • さまざまな画像の歪みや摂動下での自己教師ありモデルと教師ありモデルの一般化行動を比較すること。
  • 自己教師ありモデルが、特に形状対テクスチャの観点から、人間の認識と同様の不変性やバイアスを示すかどうかを評価すること。
  • 多様な視覚刺激において、モデルの誤りと人間の誤りパターンとの整合性を評価すること。
  • 対照的自己教師あり学習が、教師あり学習とは根本的に異なるインダクティブバイアスを生じるかどうかを検証すること。

提案手法

  • ResNet-50アーキテクチャを用いて、8つの自己教師ありモデル(PIRL, MoCo, MoCoV2, InfoMin, InsDis, SimCLR-x1/x2/x4)と24の教師ありモデル(例:ResNet, VGG, DenseNet)を訓練した。
  • 評価のため、ImageNetを用いて各自己教師あり表現の上に線形分類器をファインチューニングした。
  • 12種類の画像劣化タイプ(例:ノイズ、回転、位相ノイズ)およびテクスチャ対形状の矛盾を含むデータセットでモデルを評価した。
  • 人間の心理物理学的データ(130,000回の試行)を、人間らしい行動のベンチマークとして[4, 5]から使用した。
  • 画像レベルおよびカテゴリレベルの予測における、モデルと人間の誤りパターンの類似性を分析するため、誤り整合性分析を適用した。
  • 形状とテクスチャが異なるカテゴリに属するテクスチャ対形状の手がかりの矛盾データセットを用いて、テクスチャバイアスを定量化した。

実験結果

リサーチクエスチョン

  • RQ1自己教師ありモデルは、画像の歪みや劣化に対して、教師ありモデルよりも優れた一般化性能を示すか?
  • RQ2自己教師ありモデルは、分布外の刺激に対して、人間の誤りと似た誤りをしたり、教師ありモデルと似た誤りをしたりするか?
  • RQ3自己教師ありモデルは、物体認識においてテクスチャや形状にバイアスを示すか?そのバイアスは人間の知覚とどのように比較できるか?
  • RQ4自己教師ありモデルと教師ありモデルは、意思決定プロセスにおいてどの程度類似したインダクティブバイアスを共有しているか?
  • RQ5特定のデータ拡張を用いるSimCLRは、他の自己教師あり手法と比較して、耐性や人間らしさの観点で例外的であるか?

主な発見

  • ほとんどの自己教師ありモデルは、教師ありモデルと同様に画像の歪みに対して脆弱であり、ノイズ耐性が低いが、SimCLRを除いては顕著な例外がなかった。
  • 自己教師ありモデルは、教師ありモデルと強く類似した誤り整合性を示しており、特に画像レベルの誤りパターンにおいて顕著で、類似したインダクティブバイアスが背後に存在していることを示唆している。
  • 自己教師ありモデルのカテゴリレベルの誤りパターンは人間の行動と乖離しており、人間の知覚的グループ化や分類と一致しない。
  • テストされたすべての自己教師ありモデルが強いテクスチャバイアスを示しており、SimCLRが最もバイアスが小さい(58.3–61.2%のテクスチャ意思決定)、それでも教師ありInception-V3(60.7%)と同等の水準であった。
  • 自己教師ありモデルにおけるテクスチャバイアスは、対照的学習の目的関数によって軽減されないため、データ拡張がこのバイアスの形成に重要な役割を果たしていると考えられる。
  • 根本的に異なる訓練目的を持つにもかかわらず、自己教師ありモデルは人間の視覚認識行動と類似性を示さず、現在のアプローチが人間のような不変性や耐性をまだ達成していないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。