Skip to main content
QUICK REVIEW

[論文レビュー] Studying Invariances of Trained Convolutional Neural Networks

Charlotte Bunne, Lukas Rahmann|arXiv (Cornell University)|Mar 15, 2018
Advanced Neural Network Applications参考文献 3被引用数 7
ひとこと要約

本論文では、アレクサンネットやレスネットのような訓練済みCNNに対して不変である微分可能なパラメータを有する可学習モジュール、不変変換ネットを提案する。アフィンおよび非アフィン変換のスケールを広くスクリーニングした結果、分類精度が低下するまでのクラスおよび変換固有のしきい値が明らかになり、不変性が中程度の変換の大きさに限定されることを示している。

ABSTRACT

Convolutional Neural Networks (CNNs) define an exceptionally powerful class of models for image classification, but the theoretical background and the understanding of how invariances to certain transformations are learned is limited. In a large scale screening with images modified by different affine and nonaffine transformations of varying magnitude, we analyzed the behavior of the CNN architectures AlexNet and ResNet. If the magnitude of different transformations does not exceed a class- and transformation dependent threshold, both architectures show invariant behavior. In this work we furthermore introduce a new learnable module, the Invariant Transformer Net, which enables us to learn differentiable parameters for a set of affine transformations. This allows us to extract the space of transformations to which the CNN is invariant and its class prediction robust.

研究の動機と目的

  • アレクサンネットやレスネットのような訓練済みCNNのさまざまな変換下での不変性特性を体系的に分析すること。
  • 正しく分類を保持するためのアフィンおよび非アフィン変換の最大大きさを特定し、変換固有のロバストネスのしきい値を明らかにすること。
  • CNNが不変である変換の空間を同定するための可学習で微分可能なモジュール、不変変換ネットを開発すること。
  • 異なるアーキテクチャ間での不変性の挙動を比較し、不変性とネットワークの深さや構造との相関関係を理解すること。
  • 訓練済みCNNの不変性空間を制御的かつパラメータ化された方法でプローブおよび抽出するための手法を提供すること。

提案手法

  • 不変変換ネットは、学習可能な重み $k_1$(空間)および $k_2$(色)でパrameter化されたアフィン変換を適用する微分可能なモジュールとして導入され、CNNとエンドツーエンドで訓練可能である。
  • ネットワークはImageNetの検証画像を用いて訓練され、CNNの $ abla_{ heta} ext{Loss}_{ ext{orig}}$ と変換器の $ abla_{k_1,k_2} ext{Loss}_{ ext{transform}}$ の組み合わせ損失を最小化する。その目的は、変換下でも分類精度を維持することにある。
  • 大規模なスクリーニングにより、翻訳、回転、ノイズ、ズームなどの変換の大きさを増加させた場合のアレクサンネットおよびレスネットのソフトマックス出力への影響が評価される。
  • 各画像クラスについて、変換パラメータを段階的に増加させながら平均ソフトマックス確率を追跡し、予測の信頼性が低下する点を特定する。
  • 事前学習済みモデル(アレクサンネットおよびレスネット-101)を用い、入力画像にガウスノイズ、回転、ズーム、翻訳などの変換を適用する。
  • 不変変換ネットは、分類精度を高い水準に維持する変換を見つけるように訓練され、各クラスにおける最大不変性空間を効果的に学習する。

実験結果

リサーチクエスチョン

  • RQ1アレクサンネットおよびレスネットが不変であるアフィンおよび非アフィン変換の最大大きさは何か?
  • RQ2回転、ノイズ、ズームなどの異なる変換タイプが、画像クラス全体での分類ロバストネスにどのように影響するか?
  • RQ3可学習で微分可能なモジュール、不変変換ネットは、CNNが不変である変換の空間を同定できるか?
  • RQ4不変性のしきい値は、異なる画像クラスおよび変換タイプでどのように変化するか?
  • RQ5より深いネットワーク、たとえばレスネットは、浅いネットワーク(アレクサンネット)と整合性のある不変性を学習するのか?

主な発見

  • アレクサンネットおよびレスネットは、アフィンおよび非アフィン変換に対して、変換の大きさがクラスおよび変換固有のしきい値以下である場合にのみ不変性を示す。
  • 回転に関しては、約180°を超えると不変性が崩れ、高角度での回転では分類精度が著しく低下する。
  • 不変変換ネットは、軽微なズームアウトや小さな色のずれといった情報損失の少ない変換を効果的に学習するが、極端な回転やズームインのような高マグニチュードの歪みは避ける。
  • ネットワークは色の変化に対して高い感受性を示し、低マグニチュードの色変換しか学習しないため、色の摂動に対して本質的に脆弱であると考えられる。
  • 両ネットワークの学習された不変性空間はアーキテクチャを問わず一貫しており、レスネットは同様の変換に対してアレクサンネットと同等の不変性しきい値を示す。
  • 大規模なスクリーニングにより、ガウスノイズやコントラストの変化といった非アフィン変換は、特に中程度のノイズレベルを超えると信頼性を著しく低下させ、ロバストネスが限定的であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。