[論文レビュー] Activate or Not: Learning Customized Activation
本稿では、ニューロンの活性化を動的に決定できる学習可能な活性化関数であるACONを提案する。この関数は、Maxoutを滑らかで微分可能な関数で近似することで、ReLU や Swish よりも優れた性能を示し、MobileNet-0.25 と ResNet-152 においてそれぞれ 6.7% および 1.8% のトップ1精度向上を達成する。メタ-ACONを用いることで、活性化スイッチの明示的学習が可能となり、さらなる精度向上が達成される。
We present a simple, effective, and general activation function we term ACON which learns to activate the neurons or not. Interestingly, we find Swish, the recent popular NAS-searched activation, can be interpreted as a smooth approximation to ReLU. Intuitively, in the same way, we approximate the more general Maxout family to our novel ACON family, which remarkably improves the performance and makes Swish a special case of ACON. Next, we present meta-ACON, which explicitly learns to optimize the parameter switching between non-linear (activate) and linear (inactivate) and provides a new design space. By simply changing the activation function, we show its effectiveness on both small models and highly optimized large models (e.g. it improves the ImageNet top-1 accuracy rate by 6.7% and 1.8% on MobileNet-0.25 and ResNet-152, respectively). Moreover, our novel ACON can be naturally transferred to object detection and semantic segmentation, showing that ACON is an effective alternative in a variety of tasks. Code is available at https://github.com/nmaac/acon.
研究の動機と目的
- NASで探索されたSwishのメカニズムを理解し、それを改善すること。
- Maxout族の活性化関数に対する一般化された滑らかで微分可能な近似を考案すること。
- 線形と非線形の挙動の間を切り替える学習可能なメカニズムを設計し、ニューロンの活性化・非活性化を明示的に学習すること。
- 追加の計算コストを伴わずに、小規模・大規模・高度に最適化されたモデルの性能を向上させること。
- 提案された活性化関数が、物体検出およびセマンティックセグメンテーションのタスクにおいても一般化可能であることを示すこと。
提案手法
- Maxoutに対する滑らかで微分可能な近似としてACONを提案し、Swishはその特別な場合であることを示す。
- 固定された境界の制限を克服するため、勾配に学習可能な上限および下限を導入する。
- ゼロに徐々に減少するスイッチングファクターを設計し、非線形から線形への動的遷移を可能にする。
- メタ・ラーナーを用いてスイッチング要因の活性化意思決定を明示的に学習するメタ-ACONを開発し、学習の安定性を向上させる。
- MobileNet、ResNet、RetinaNet、PSPNet などのさまざまなアーキテクチャにACONおよびメタ-ACONを適用する。
- バックボーンネットワークにおけるReLUをメタ-ACONに置き換えることで、ACONを物体検出およびセマンティックセグメンテーションに適用する。
実験結果
リサーチクエスチョン
- RQ1NASで探索されたSwish活性化関数はどのように機能するのか? また、これはReLUの滑らかな近似として解釈可能か?
- RQ2Maxout族を、モデル性能を向上させる滑らかで学習可能な活性化関数へ一般化可能か?
- RQ3線形と非線形の挙動の間を切り替える学習可能なスイッチングメカニズムは、モデルの精度向上に寄与可能か?
- RQ4活性化意思決定を明示的に学習するメタ-ACONは、スイッチングファクターの勾配ベース最適化と比較して優れているか?
- RQ5ACONは、物体検出やセマンティックセグメンテーションなどの多様なタスクへ効果的に転送可能か?
主な発見
- ACONは、ReLUと比較して、MobileNet-0.25 でトップ1精度が 6.7% 向上し、ResNet-152 では 1.8% 向上した。
- メタ-ACONは、ResNet-152 で 1.3% 向上し、SENet-154 で 1.7% 向上し、Swish や SENet を上回った。
- COCO物体検出タスクでは、メタ-ACONが 36.5 mAP を達成し、ReLU より 1.3 ポints 向上し、Swish より 0.7 ポイント向上した。
- CityScapeにおけるセマンティックセグメンテーションでは、メタ-ACONが 78.3 平均インダックス・ユーティリティ(mean IU)を達成し、ReLU より 1.1 ポイント向上し、Swish より 0.8 ポイント向上した。
- ACONは、小規模モデル(例:MobileNet-0.25)および大規模で高度に最適化されたモデル(例:ResNet-152、SENet-154)において一貫した性能向上を示した。
- 本手法は優れた一般化性能を示し、顕著な計算オーバーヘッドがなく、検出およびセグメンテーションタスクへの転送が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。