Skip to main content
QUICK REVIEW

[論文レビュー] Towards Learning Affine-Invariant Representations via Data-Efficient CNNs

Xenju Xu, Guanghui Wang|arXiv (Cornell University)|Aug 31, 2019
Advanced Neural Network Applications参考文献 46被引用数 7
ひとこと要約

本稿では、深層学習におけるアフィン不変表現を学習するための、回転不変正則化子を備えた新規なマルチスケールマックスアウトCNNを提案する。2次元畳み込みフィルタが円形パターンを近似するように制約を課すことで、優れたデータ効率性とロバスト性を達成し、1クラスあたり10枚の画像でのTraffic Signデータセットで84.15%の精度を達成した。これはSOTAを29.80%上回る性能である。

ABSTRACT

In this paper we propose integrating a priori knowledge into both design and training of convolutional neural networks (CNNs) to learn object representations that are invariant to affine transformations (i.e., translation, scale, rotation). Accordingly we propose a novel multi-scale maxout CNN and train it end-to-end with a novel rotation-invariant regularizer. This regularizer aims to enforce the weights in each 2D spatial filter to approximate circular patterns. In this way, we manage to handle affine transformations in training using convolution, multi-scale maxout, and circular filters. Empirically we demonstrate that such knowledge can significantly improve the data-efficiency as well as generalization and robustness of learned models. For instance, on the Traffic Sign data set and trained with only 10 images per class, our method can achieve 84.15% that outperforms the state-of-the-art by 29.80% in terms of test accuracy.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)において、平行移動、スケーリング、回転といったアフィン変換不変表現を、インダクティブバイアスを用いて学習する課題に対処する。
  • ネットワーク設計および学習に事前知識を統合することで、オブジェクト認識におけるデータ効率性、一般化性能、ロバスト性を向上させる。
  • 2次元畳み込みフィルタが円形パターンを近似するように制約を課す新規な正則化子を開発する。
  • 構造的および機能的事前知識を深層学習に統合することで、より予測可能で解釈可能でロバストなモデルが得られることを示す。
  • アフィン変換を伴う・伴わないベンチマークデータセットに対して、特に低データ環境下での評価を実施する。

提案手法

  • マックスアウトユニットを用いて複数の空間スケールにわたる特徴を捉えるマルチスケールマックスアウトCNNアーキテクチャを設計する。
  • 2次元畳み込みフィルタの円対称性からの逸脱をペナルティ化する新規な回転不変正則化子を導入する。
  • 正則化子を、フィルタ重みが径数基底関数または円形パターンに一致するように促すティコノフ型ペナルティとして定式化する。
  • 最適化中に回転不変性を強制するために、提案された正則化子を用いてネットワークをエンドツーエンドで学習する。
  • モデルの複雑さを制御し、パラメータ数、精度、推論速度のトレードオフを分析するためにチャネル単位のプルーニングを活用する。
  • マルチスケール畳み込みとマックスアウトを用いてスケール不変性を強化する一方で、正則化子は特に回転不変性に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1回転対称性に関する事前知識をCNNに効果的に組み込むことで、アフィン変換に対する不変性を向上させることができるか?
  • RQ2円形フィルタパターンを促進する回転不変正則化子が、モデルの一般化性能およびデータ効率に与える影響は何か?
  • RQ3限られたデータで学習された場合、このような手法が最先端のアプローチをどの程度上回るか?
  • RQ4パrameter数の増加に伴い、モデルの性能はどのように変化するか。また、提案された正則化子の計算コストはどの程度か?
  • RQ5構造的バイアス(マルチスケールマックスアウト、円形フィルタ)の統合により、より解釈可能でロバストな深層学習モデルが得られるか?

主な発見

  • 1クラスあたり10枚の画像でのTraffic Signデータセットにおいて、提案手法は84.15%のテスト精度を達成し、SOTAを29.80%上回った。
  • affNISTでは、回転不変正則化子により平均で1.52%の精度向上が得られ、正則化損失値が2.94×10⁻⁷であった。これは円形フィルタパターンへの強い適合を示している。
  • CIFAR-100で1クラスあたり100枚の学習画像を使用した場合、本手法は52.67%のテスト精度を達成した。これはResNet-32(約10ポイント高い)およびTI-Pooling(31.77%)よりも顕著に優れていた。
  • パrameter数を削減してもモデルの性能を維持でき、[32,64,64,64,64]の構成で約20万パラメータでほぼ最適な精度を達成した。
  • 学習および推論時間はパrameter数に伴い指数関数的に増加するが、パラメータ効率性が高く、Harmonicsより高速であり、STNと同等の推論速度を維持した。
  • CIFAR-100で全学習データを使用した場合、本手法は78.33%の精度を達成し、ResNet-32(76.7%)およびGoogleNet(78.03%)を上回り、不変性を目的とした他の手法(例:TI-Pooling 31.77%)を大きく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。