Skip to main content
QUICK REVIEW

[論文レビュー] Capsule Network is Not More Robust than Convolutional Network

Jindong Gu, Volker Tresp|arXiv (Cornell University)|Mar 29, 2021
Adversarial Robustness in Machine Learning参考文献 16被引用数 4
ひとこと要約

この論文は、キャプセルネットワーク(CapsNets)が畳み込みニューラルネットワーク(ConvNets)よりも頑健であるという広く信じられている考えに挑戦する。包括的なアブレーションスタディを通じて、動的ルーティングと変換行列がアフィン変換および重なった数字の認識に対して頑健性を損なう要因であることが明らかになった。一方、スイーピング関数やクラス条件付き再構成は、意味的コンパクトネスを向上させる。著者らは、これらの有益な要素を標準的なConvNetsに組み込み、評価されたすべてのタスクでCapsNetsを上回る頑健性を達成した。

ABSTRACT

The Capsule Network is widely believed to be more robust than Convolutional Networks. However, there are no comprehensive comparisons between these two networks, and it is also unknown which components in the CapsNet affect its robustness. In this paper, we first carefully examine the special designs in CapsNet that differ from that of a ConvNet commonly used for image classification. The examination reveals five major new/different components in CapsNet: a transformation process, a dynamic routing layer, a squashing function, a marginal loss other than cross-entropy loss, and an additional class-conditional reconstruction loss for regularization. Along with these major differences, we conduct comprehensive ablation studies on three kinds of robustness, including affine transformation, overlapping digits, and semantic representation. The study reveals that some designs, which are thought critical to CapsNet, actually can harm its robustness, i.e., the dynamic routing layer and the transformation process, while others are beneficial for the robustness. Based on these findings, we propose enhanced ConvNets simply by introducing the essential components behind the CapsNet's success. The proposed simple ConvNets can achieve better robustness than the CapsNet.

研究の動機と目的

  • キャプセルネットワークが畳み込みニューラルネットワークよりも本質的に頑健であるという一般的な仮定に挑戦すること。
  • CapsNet内のどのコンポーネントが頑健性に実際に寄与しているか、どのコンポーネントが性能を低下させているかを特定すること。
  • アフィン変換、重なった数字、意味的表現の3つの頑健性指標に与える影響を評価すること。
  • 動的ルーティング、変換行列、スイーピング関数、マージン損失、再構成の各CapsNet固有のコンポーネントが、3つの頑健性指標に与える影響を評価すること。
  • キーパラメータを備えた単純なConvNetが、CapsNetを上回る頑健性を示すことを実証すること。

提案手法

  • アフィン変換、重なった数字認識、意味的表現のコンパクトネスの3つの頑健性ベンチマークを用いて、CapsNetのコンポーネントに対するアブレーションスタディを実施する。
  • 空間不変性と一般化性能を向上させるグローバル平均プーリングを備えた変更されたConvNetベースラインを実装する。
  • 動的ルーティング、変換行列、スイーピング関数、マージン損失、クラス条件付き再構成の各CapsNetコンポーネントを個別に導入・評価する。
  • 表現ベクトルの正規化された分散と一様事前分布とのKLダイバージェンスに基づくコンパクトネススコアを用いて、意味的表現の質を定量化する。
  • キャプセルおよび特徴マップの活性化に摂動を加えることで、再構成画像における意味的感度を分析する。
  • 制御された環境下でMNISTおよびFMNISTデータセット上でモデルを学習・比較し、コンポーネントの影響を隔離する。

実験結果

リサーチクエスチョン

  • RQ1CapsNetsにおける動的ルーティング機構は、アフィン変換に対して本当に頑健性を向上させるのか、それとも性能を低下させるのか?
  • RQ2CapsNetsにおける非共有の変換行列と非共有重みは、重なった数字の認識にどの程度寄与しているのか?
  • RQ3スイーピング関数とクラス条件付き再構成損失は、標準的なConvNetsにおける意味的表現のコンパクトネスを向上させるのか?
  • RQ4CapsNetsの見かけ上の頑健性は、そのアーキテクチャに起因するのか、それとも過去の比較で使われた弱いConvNetベースラインによるものなのか?
  • RQ5キーパラメータを備えた単純なConvNetが、すべての頑健性指標でCapsNetを上回ることができるのか?

主な発見

  • 過去のCapsNet比較で使われた標準的なConvNetベースラインにはグローバル平均プーリングが欠けており、空間不変性と一般化性能が弱いため、公平な比較が損なわれている。
  • CapsNetsにおける動的ルーティングは、アフィン変換に対する頑健性を損なう。これは、一般に不変性を向上させるという考えとは対照的である。
  • CapsNetsが重なった数字を認識できるのは、非共有変換行列によるモデル化能力の向上のおかげであり、ルーティングやベクトル表現のおかげではない。
  • スイーピング関数とクラス条件付き再構成損失は、意味的表現のコンパクトネスを顕著に向上させ、これらはConvNetsに効果的に移行可能である。
  • スイーピング関数とクラス条件付き再構成を組み込んだ強化ConvNetsは、アフィン変換、重なった数字、コンパクトネスの3つの頑健性ベンチマークすべてでCapsNetを上回った。
  • 再構成とスイーピング関数を備えたConvNet-CR-SFのコンパクトネススコアは、trans-Yで0.3192に達し、CapsNetの0.0464を大幅に上回った。これは、優れた意味的表現を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。