Skip to main content
QUICK REVIEW

[論文レビュー] A Branching and Merging Convolutional Network with Homogeneous Filter Capsules

Adam Byerly, Tatiana Kalganova|arXiv (Cornell University)|Jan 24, 2020
Music and Audio Processing参考文献 26被引用数 47
ひとこと要約

本稿では、最終畳み込みフィルタを均一なベクトルカプセルに変換する分岐および統合パスを備えた新しい畳み込みニューラルネットワークを提案する。これにより、異なる受容 field と抽象化レベルにおける特徴抽出が向上する。本手法は、アンサンブルを用いて MNIST で 99.84% の精度を達成し、単一モデルでは 99.79% を達成する。従来のカプセルネットワークと比較して、パラメータ数と学習エポック数を 75% 減少させた。

ABSTRACT

We present a convolutional neural network design with additional branches after certain convolutions so that we can extract features with differing effective receptive fields and levels of abstraction. From each branch, we transform each of the final filters into a pair of homogeneous vector capsules. As the capsules are formed from entire filters, we refer to them as filter capsules. We then compare three methods for merging the branches--merging with equal weight and merging with learned weights, with two different weight initialization strategies. This design, in combination with a domain-specific set of randomly applied augmentation techniques, establishes a new state of the art for the MNIST dataset with an accuracy of 99.84% for an ensemble of these models, as well as establishing a new state of the art for a single model (99.79% accurate). These accuracies were achieved with a 75% reduction in both the number of parameters and the number of epochs of training relative to the previously best performing capsule network on MNIST. All training was performed using the Adam optimizer and experienced no overfitting.

研究の動機と目的

  • キーフィルタの後に分岐パスを導入することで、畳み込みネットワークにおける特徴表現を向上させること。
  • 全畳み込みフィルタから導出されたフィルタカプセルを通じて、マルチスケールおよびマルチレベルの抽象化を可能にすること。
  • MNIST における性能を維持または向上させつつ、モデルの複雑さと学習コストを低減すること。
  • 異なる初期化手法を用いた等価重みと学習重みの統合戦略を評価し、最適なパフォーマンスを得ること。

提案手法

  • 特定の畳み込み層の後に追加のパスを導入し、異なる有効受容 field を持つ特徴を抽出する。
  • 各パスの最終畳み込みフィルタが、均一なベクトルカプセル(フィルタカプセルと呼ぶ)に変換される。
  • 3 種類の統合戦略を評価する:単純平均(等価重み)、ランダム初期化を用いた学習重み、Xavier 初期化を用いた学習重み。
  • ネットワークは Adam 最適化手法を用い、過学習を防ぐためにドメイン固有のデータ拡張技術を適用する。
  • カプセル変換により、全フィルタ出力をベクトル表現としてエンコードすることで、空間的および階層的情報を保持する。
  • 過学習の兆候が見られず、積極的なデータ拡張を行ってもエンドツーエンドで学習が可能である。

実験結果

リサーチクエスチョン

  • RQ1畳み込み層の後に分岐パスを導入することで、MNIST における特徴抽象化とモデル精度が向上するか?
  • RQ2等価重みと学習重みの異なる統合戦略が、複数のパスからの特徴を統合する際のパフォーマンスに与える影響は何か?
  • RQ3本カプセルベースアーキテクチャを用いることで、パrameter 数と学習エポック数をどれだけ削減できるか?
  • RQ4全畳み込みフィルタから導出されたフィルタカプセルは、標準的な特徴マップと比較して表現学習をどのように向上させるか?
  • RQ5ドメイン固有のデータ拡張と本アーキテクチャを組み合わせることで、一般化性能を維持したままパフォーマンスをさらに向上させられるか?

主な発見

  • 提案モデルは、アンサンブル精度 99.84% を達成し、MNIST データセットで新たな SOTA を樹立した。
  • 単一モデルでも 99.79% の精度を達成し、MNIST における個別モデルの SOTA を更新した。
  • 従来の MNIST で最高のカプセルネットワークと比較して、パrameter 数と学習エポック数の両方を 75% 減少させた。
  • 広範なデータ拡張と高い容量にもかかわらず、過学習の兆候が一切見られなかった。
  • Xavier 初期化を用いた学習重み統合が、他の統合戦略を上回り、カプセル統合における適切な重み初期化の重要性を示した。
  • フィルタカプセルの使用により、計算効率を維持したまま効果的な階層的特徴表現が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。