Skip to main content
QUICK REVIEW

[論文レビュー] Learning Convolutional Neural Networks using Hybrid Orthogonal Projection and Estimation

Hengyue Pan, Hui Jiang|arXiv (Cornell University)|Jun 20, 2016
Image Processing Techniques and Applications被引用数 8
ひとこと要約

本稿では、特徴抽出における直交性を強制することで畳み込みニューラルネットワーク(CNN)の性能を向上させるため、ハイブリッド直交射影と推定(HOPE)を提案する。2つの変種—HOPE-Input(入力層後に適用)およびHOPE-Pooling(標準のプーリング層を置き換え)—を導入し、特徴の相関性とノイズを低減した。データ拡張なしでCIFAR-10およびCIFAR-100でSOTAのトップ3誤差率を達成した。

ABSTRACT

Convolutional neural networks (CNNs) have yielded the excellent performance in a variety of computer vision tasks, where CNNs typically adopt a similar structure consisting of convolution layers, pooling layers and fully connected layers. In this paper, we propose to apply a novel method, namely Hybrid Orthogonal Projection and Estimation (HOPE), to CNNs in order to introduce orthogonality into the CNN structure. The HOPE model can be viewed as a hybrid model to combine feature extraction using orthogonal linear projection with mixture models. It is an effective model to extract useful information from the original high-dimension feature vectors and meanwhile filter out irrelevant noises. In this work, we present three different ways to apply the HOPE models to CNNs, i.e., {\em HOPE-Input}, {\em single-HOPE-Block} and {\em multi-HOPE-Blocks}. For {\em HOPE-Input} CNNs, a HOPE layer is directly used right after the input to de-correlate high-dimension input feature vectors. Alternatively, in {\em single-HOPE-Block} and {\em multi-HOPE-Blocks} CNNs, we consider to use HOPE layers to replace one or more blocks in the CNNs, where one block may include several convolutional layers and one pooling layer. The experimental results on both Cifar-10 and Cifar-100 data sets have shown that the orthogonal constraints imposed by the HOPE layers can significantly improve the performance of CNNs in these image classification tasks (we have achieved one of the best performance when image augmentation has not been applied, and top 5 performance with image augmentation).

研究の動機と目的

  • 標準のCNNアーキテクチャにハイブリッド直交射影と推定(HOPE)フレームワークを統合し、特徴表現を向上させること。
  • 特徴射影層における直交制約が、画像分類タスクにおけるCNN性能に与える影響を調査すること。
  • HOPEをCNNの異なる段階に適用した場合の有効性を評価すること—特に、入力変換(HOPE-Input)またはプーリングの置き換え(HOPE-Pooling)としての適用。
  • データ拡張なしで、HOPEベースのモデルをベースラインCNNおよび他のSOTAアーキテクチャとCIFAR-10およびCIFAR-100で比較すること。
  • GPUハードウェア上でのトレーニング速度およびリソース使用量の観点から、HOPEレイヤーの計算効率を評価すること。

提案手法

  • 入力直後に線形直交射影レイヤーを適用し、高次元入力特徴の相関を解消する(HOPE-Input)。
  • 標準のマックスまたは平均プーリング層を、次元削減を直交射影で行いながら有用な情報を保持するHOPEレイヤーに置き換える(HOPE-Pooling)。
  • 損失関数にペナルティ項を導入し、HOPEレイヤーの射影行列に直交制約を課すことで、トレーニング中に変換行列が正規直交を保つようにする。
  • バックプロパゲーションを用いて、最大尤度推定および最小交差エントロピー学習をHOPEフレームワーク下で実行し、射影レイヤーの直交性を維持する。
  • 学習可能なスケーリング係数βを有するパラメータ化された直交行列を用いてHOPEレイヤーを実装し、25エポックごとに更新することで収束を改善する。
  • すべてのモデルをミニバッチSGDでトレーニングし、固定されたハイパーパrameterを設定:初期値の学習率=0.06、25エポックごとに半減、モーメンタム=0.9、重み減衰=0.0005、すべての重みに対してHe初期化を適用。

実験結果

リサーチクエスチョン

  • RQ1HOPEフレームワークは、画像分類性能の向上を目的としたCNNに効果的に適応可能か?
  • RQ2HOPEによる特徴射影層における直交性の強制は、標準CNNと比較して一般化性能を向上させ、誤差率を低減するか?
  • RQ3CIFAR-10およびCIFAR-100における分類精度と耐障害性の観点から、HOPE-InputとHOPE-Poolingの性能はどのように比較されるか?
  • RQ4CNNにHOPEレイヤーを統合する際の計算オーバーヘッドは何か?また、GPUハードウェア上でも効率的か?
  • RQ5HOPEベースのCNNは、特にCIFAR-10およびCIFAR-100のような小規模ベンチマークで、データ拡張なしにSOTA性能を達成できるか?

主な発見

  • HOPE-InputとHOPE-Poolingを組み合わせたCNNは、CIFAR-10でトップ3誤差率7.57%、CIFAR-100で29.80%を達成し、データ拡張なしでSOTA性能を示した。
  • HOPE-Inputは、ベースラインの8.30%から7.81%へ、CIFAR-10で誤差率を低下。CIFAR-100でも30.71%から29.96%へ改善し、一貫した向上を示した。
  • HOPE-PoolingはCIFAR-10で8.21%、CIFAR-100で30.60%の誤差率を達成し、ベースラインおよびLIN-Pooling設定を上回った。
  • HOPE-InputとHOPE-Poolingの組み合わせが最良の全体的性能を示し、ALL-CNN、Maxout、Network in Networkなどの有名モデルを上回った。
  • HOPEベースのモデルの学習速度(190–208画像/秒)は、ベースラインモデル(220画像/秒)と比較してわずかに遅く、計算オーバーヘッドはほとんどないことを示した。
  • 直交制約なしのLINバージョンは、常にそのHOPE対応バージョンを下回り、特徴学習における直交性の強制が有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。