Skip to main content
QUICK REVIEW

[論文レビュー] Funnel Activation for Visual Recognition

Ningning Ma, Xiangyu Zhang|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 46被引用数 14
ひとこと要約

本論文は、小さな畳み込みフィルタを介した学習可能な空間的条件を適用することにより、ReLU や PReLU を拡張する新しい 2D スペーシングに配慮した活性化関数である Funnel Activation (FReLU) を導入する。FReLU は最小限の計算オーバーヘッドでピクセル単位の特徴モデリングを可能にし、ImageNet、COCO 検出、Cityscapes のセマンティックセグメンテーションにおいて最先端の性能を達成する。FReLU はすべてのタスクで ReLU や PReLU を上回り、ResNet や MobileNet といった既存アーキテクチャと高い互換性を示す。

ABSTRACT

We present a conceptually simple but effective funnel activation for image recognition tasks, called Funnel activation (FReLU), that extends ReLU and PReLU to a 2D activation by adding a negligible overhead of spatial condition. The forms of ReLU and PReLU are y = max(x, 0) and y = max(x, px), respectively, while FReLU is in the form of y = max(x,T(x)), where T(x) is the 2D spatial condition. Moreover, the spatial condition achieves a pixel-wise modeling capacity in a simple way, capturing complicated visual layouts with regular convolutions. We conduct experiments on ImageNet, COCO detection, and semantic segmentation tasks, showing great improvements and robustness of FReLU in the visual recognition tasks. Code is available at https://github.com/megvii-model/FunnelAct.

研究の動機と目的

  • 視覚認識タスクにおけるスカラー活性化の空間的文脈を捉える能力の制限を解消すること。
  • モデルの複雑さを増さずに空間的文脈を活用して特徴表現を向上させる、シンプルかつ効果的な活性化メカニズムを設計すること。
  • 変更された活性化関数のみを用いて、密度予測タスク(例:セグメンテーション、検出)およびスパarsity予測タスク(例:分類)の性能を向上させること。
  • 既存の注目メカニズム(例:SENet)と互換性があり、相乗効果を発揮することを示すこと。

提案手法

  • FReLU は、ReLU のスカラー閾値を、入力特徴マップの学習可能な 2D 空間的条件に置き換える。定義は y = max(x, T(x)) であり、T(x) は小さな畳み込み特徴マップである。
  • 空間的条件 T(x) は、入力特徴マップに 1×1 または小さなカーネル(例:3×3、5×5)の畳み込みを適用することで計算され、局所的な空間的文脈モデリングを可能にする。
  • この手法は計算オーバーヘッドが最小限であり、1層あたり数FLOPs の追加にとどまる。
  • FReLU は畳み込み層の後に適用され、特に残差ブロック内の 1×1 および 3×3 畳み込みの後で特徴表現を強化する。
  • 空間的条件はトレーニング中にエンドツーエンドで学習され、ネットワークが複雑な視覚的レイアウトを適応的にモデリングできる。
  • 本手法は、複数のアーキテクチャ(ResNet-50、MobileNet、ShuffleNetV2)およびタスク(分類、検出、セグメンテーション)で評価された。

実験結果

リサーチクエスチョン

  • RQ1活性化関数にシンプルで学習可能な空間的条件を組み込むことで、視覚認識タスクの性能を顕著に向上させることができるか?
  • RQ2FReLU のような 2D スペーシングに配慮した活性化関数は、スパarsity予測タスクと密度予測タスクの両方で、標準的なスカラー活性化関数(例:ReLU、PReLU)を上回る性能を発揮するか?
  • RQ3SENet などの注目メカニズムと組み合わせた場合、FReLU はどのように性能を発揮するか?
  • RQ4CNN アーキテクチャ内での FReLU の最適な配置(例:1×1 と 3×3 畳み込みの後、浅い段階と深い段階のどちらか)はどこか?

主な発見

  • FReLU は、ResNet-50 において ImageNet のトップ-1誤差率を 24.0%(ReLU 時)から 22.4% に低下させ、1.6% の絶対的改善を達成した。
  • COCO 物体検出タスクにおいて、FReLU は ResNet-50 をバックボーンとして使用した場合、mAP を ReLU よりも 1.2% 向上させた。
  • Cityscapes のセマンティックセグメンテーションでは、FReLU が ReLU よりも平均 IoU で 1.5% 高く、密度予測タスクへの強い一般化能力を示した。
  • FReLU は単体で使用した場合、SENet よりも高い性能を発揮し、SENet と組み合わせるとさらに精度が向上し、22.1% に到達した。これは強い相互運用性を示している。
  • 最も高い性能は、残差ブロック内の 1×1 および 3×3 畳み込みの両方の後に FReLU を適用した場合に得られ、ImageNet でのトップ-1誤差率は 22.4% であった。
  • ResNet-50 の初期段階(第2〜第4段階)に FReLU を適用すると、深い段階に適用するよりも大きな向上効果が得られ、フル構成で 22.4% の最低誤差率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。