Skip to main content
QUICK REVIEW

[論文レビュー] Factorized Bilinear Models for Image Recognition

Yanghao Li, Naiyan Wang|arXiv (Cornell University)|Nov 17, 2016
Advanced Neural Network Applications参考文献 35被引用数 4
ひとこと要約

本論文は、低ランクパラメータ化を用いて、深層ニューラルネットワークにおけるペairワイズ特徴相互作用をモデル化するためのファクタライズドバイリニア(FB)レイヤーを提案する。これにより、線形の計算およびパラメータの複雑さで二次非線形性を実現できる。この手法は、最小限の計算オーバーヘッドとDropFactor正則化技術による一般化の向上を伴い、CIFAR-10、CIFAR-100、ImageNetで最先端の性能を達成する。

ABSTRACT

Although Deep Convolutional Neural Networks (CNNs) have liberated their power in various computer vision tasks, the most important components of CNN, convolutional layers and fully connected layers, are still limited to linear transformations. In this paper, we propose a novel Factorized Bilinear (FB) layer to model the pairwise feature interactions by considering the quadratic terms in the transformations. Compared with existing methods that tried to incorporate complex non-linearity structures into CNNs, the factorized parameterization makes our FB layer only require a linear increase of parameters and affordable computational cost. To further reduce the risk of overfitting of the FB layer, a specific remedy called DropFactor is devised during the training process. We also analyze the connection between FB layer and some existing models, and show FB layer is a generalization to them. Finally, we validate the effectiveness of FB layer on several widely adopted datasets including CIFAR-10, CIFAR-100 and ImageNet, and demonstrate superior results compared with various state-of-the-art deep models.

研究の動機と目的

  • 畳み込み層および全結合層の表現能力を線形変換を越えて向上させること。
  • 高価なパラメータや計算コストを負担せずに、効率的にペアワイズ特徴相互作用をモデル化すること。
  • 新しい正則化法であるDropFactorにより、バイリニアモデルにおける過学習を是正すること。
  • スケーラビリティを維持したまま、バイリニアプーリングを深層ネットワークのすべての層に一般化すること。

提案手法

  • バイリニア変換行列の低ランク因子分解を用いて、二次的特徴相互作用をモデル化するファクタライズドバイリニア(FB)レイヤーを提案する。
  • ランク制約付きのパラメータ化を用いることで、入力次元に対して線形の複雑さにパラメータ数と計算コストを削減する。
  • トレーニング中にバイリニア要因の要素をランダムにゼロに設定する、ドロップアウトに類似した正則化法であるDropFactorを導入する。
  • FBレイヤーを畳み込み層および全結合層の両方へ適用し、標準的なバックプロパゲーションを用いたエンドツーエンド学習を可能にする。
  • 公平な比較のため、ImageNetで学習する際には標準的なデータオーグメンテーションおよび初期化戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1パラメータ数が爆発的に増加することなく、深層ネットワークでペアワイズ特徴相互作用を効率的にモデル化できるか?
  • RQ2バイリニアレイヤーの低ランク因子分解が、表現力の維持と計算コストの削減を両立できるか?
  • RQ3DropFactorのような専用の正則化法が、バイリニアレイヤーにおける過学習を効果的に防止できるか?
  • RQ4提案されたFBレイヤーが、小規模(CIFAR)および大規模(ImageNet)データセットを含む多様なベンチマークで性能向上をもたらすか?

主な発見

  • CIFAR-100では、提案されたResNet-164-FBNモデルがトップ-1誤差23.64%を達成し、ベースラインのResNet-164(5.30%誤差)および他の最先端モデルを上回った。
  • ImageNetでは、ResNet-50-FBNがトップ-1誤差を24.0%に低下させ、ベースラインのResNet-50(24.7%誤差)と比較して0.7%の改善を達成した。
  • Inception-BN-FBNの変種は、ImageNetでトップ-1誤差26.4%を達成し、元のInception-BN(27.5%誤差)と比較して1.1%の改善を示した。
  • 細粒度データセットでは、FBNはCUB-200-2011で17.09%の誤差、DTDで32.20%の誤差を記録し、標準のVGG-16を上回り、計算コストが低いにもかかわらずバイリニアプーリング手法と同等またはそれを上回った。
  • FBNモデルは、パラメータ数と推論時間の増加が線形にとどまり、メモリと計算コストが低く抑えられていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。