Skip to main content
QUICK REVIEW

[論文レビュー] Grounding inductive biases in natural images:invariance stems from variations in data

Diane Bouchacourt, Mark Ibrahim|arXiv (Cornell University)|Jun 9, 2021
Domain Adaptation and Few-Shot Learning被引用数 9
ひとこと要約

本論文は、ImageNetにおけるデータのばらつきが視覚モデルの帰納的バイアスをどのように生じさせるかを調査し、特に平行移動とスケーリングが不変性を主に決定づけることが示された。残差ネットワークが事前に平行移動不変性を備えているにもかかわらず、平行移動のみでほぼ最大の性能向上が達成され、学習された不変性は実際のImageNetの変動要因とよく一致しており、モデルの頑健性の主な要因はデータそのものであることが示された。

ABSTRACT

To perform well on unseen and potentially out-of-distribution samples, it is desirable for machine learning models to have a predictable response with respect to transformations affecting the factors of variation of the input. Here, we study the relative importance of several types of inductive biases towards such predictable behavior: the choice of data, their augmentations, and model architectures. Invariance is commonly achieved through hand-engineered data augmentation, but do standard data augmentations address transformations that explain variations in real data? While prior work has focused on synthetic data, we attempt here to characterize the factors of variation in a real dataset, ImageNet, and study the invariance of both standard residual networks and the recently proposed vision transformer with respect to changes in these factors. We show standard augmentation relies on a precise combination of translation and scale, with translation recapturing most of the performance improvement -- despite the (approximate) translation invariance built in to convolutional architectures, such as residual networks. In fact, we found that scale and translation invariance was similar across residual networks and vision transformer models despite their markedly different architectural inductive biases. We show the training data itself is the main source of invariance, and that data augmentation only further increases the learned invariances. Notably, the invariances learned during training align with the ImageNet factors of variation we found. Finally, we find that the main factors of variation in ImageNet mostly relate to appearance and are specific to each class.

研究の動機と目的

  • データ、データ拡張、モデルアーキテクチャの各要因が視覚モデルの学習された不変性に与える相対的影響を理解すること。
  • モデルの頑健性に寄与するImageNet内の自然な変動要因を特定すること。
  • ランダムリサイズドクラップなどの標準的なデータ拡張が、実際のデータにおける意味のある変換に対応しているかどうかを評価すること。
  • アーキテクチャの帰納的バイアス(例:CNNとViT)とデータ拡張のどちらが不変性の主な駆動要因であるかを評価すること。
  • 学習された不変性が、実際のImageNetの変動要因と一致しているかどうかを調査すること。

提案手法

  • 標準的なデータ拡張(ランダムリサイズドクラップ)を、平行移動とスケーリングの各成分に分解し、それらの独立した寄与を隔離した。
  • 制御された拡張を用いてResNet18およびビジョントランスフォーマー(ViT)モデルをImageNetで訓練し、さまざまな変換下での性能を測定した。
  • 自動対称性発見のためのニューラルネットワークであるAugerinoを用い、データから関連する変換を学習し、一般化への影響を評価した。
  • ImageNetバリデーションセット上で幾何変換および外観変換に対するモデル応答の一貫性を測定することで、不変性を評価した。
  • アーキテクチャ(ResNet18とViT)ごと、およびデータ拡張の有無を比較することで、頑健性の源を特定した。
  • Augerinoから得られた学習済み変換を分析し、性能に最も寄与する要因(平行移動、スケーリングなど)を特定した。

実験結果

リサーチクエスチョン

  • RQ1ランダムリサイズドクラップのような標準的なデータ拡張は、実際のImageNetデータにおける意味のある変動要因に対応しているか、どの程度対応しているか。
  • RQ2アーキテクチャの帰納的バイアス(例:CNNとViT)は不変性にどのように影響し、データのばらつきに対する反応は異なるか。
  • RQ3データ拡張が不変性の主な駆動要因であるのか、それともアーキテクチャのバイアスがより重要な役割を果たしているのか。
  • RQ4学習過程で得られた不変性は、実際のImageNetに存在する変動要因と一致しているか。
  • RQ5自動対称性発見手法(例:Augerino)は、実データセットにおける一般化性能を向上させる関連する変換を特定できるか。

主な発見

  • 残差ネットワークが既に近似的に平行移動不変性を備えているにもかかわらず、平行移動のみで標準的なランダムリサイズドクラップ拡張による性能向上の大部分を占める。
  • スケーリング拡張は平行移動に比べて寄与が僅かで、スケーリングによる性能向上は顕著に小さい。
  • 異なる帰納的バイアスを持つにもかかわらず、ResNet18とビジョントランスフォーマーの両モデルが類似したスケーリングおよび平行移動不変性を達成しており、データが主要因であることが示された。
  • 学習された不変性は、主に外観ベースでクラス固有の実際のImageNetの変動要因とよく一致している。
  • 自動的に関連する変換を発見するためのAugerinoはImageNetでは限定的な成功にとどまり、推論時に有効にすると性能が低下した。これは、このような手法を現実のデータに適用する際の課題を示している。
  • Augerinoを用いた最良のモデルは正則化パラメータλ=0.6を用いていたが、それでも標準的な平行移動のみの拡張よりも性能が低く、平行移動が最も重要な要因であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。