[論文レビュー] RMNet: Equivalently Removing Residual Connection from Networks
本稿では、ResNet や MobileNetV2 などの深層ネットワークから等価に残差接続を除去するための RMNet を提案する。残差接続の代わりに、入力特徴マップを保持し、ブロック出力とマージする「リザーブ&マージ(RM)」演算を導入することで、精度損なわず単一ブランチの VGG フレームワークに変換可能である。RMNet は、最先端の精度・速度トレードオフを達成しており、RMNet 152×6_32 は ImageNet で 80.36% のトップ1精度を達成し、ResNet-101 や RepVGG B2 を上回っている。また、剪定や推論最適化に非常に適している。
Although residual connection enables training very deep neural networks, it is not friendly for online inference due to its multi-branch topology. This encourages many researchers to work on designing DNNs without residual connections at inference. For example, RepVGG re-parameterizes multi-branch topology to a VGG-like (single-branch) model when deploying, showing great performance when the network is relatively shallow. However, RepVGG can not transform ResNet to VGG equivalently because re-parameterizing methods can only be applied to linear blocks and the non-linear layers (ReLU) have to be put outside of the residual connection which results in limited representation ability, especially for deeper networks. In this paper, we aim to remedy this problem and propose to remove the residual connection in a vanilla ResNet equivalently by a reserving and merging (RM) operation on ResBlock. Specifically, the RM operation allows input feature maps to pass through the block while reserving their information and merges all the information at the end of each block, which can remove residual connections without changing the original output. As a plug-in method, RM Operation basically has three advantages: 1) its implementation makes it naturally friendly for high ratio network pruning. 2) it helps break the depth limitation of RepVGG. 3) it leads to better accuracy-speed trade-off network (RMNet) compared to ResNet and RepVGG. We believe the ideology of RM Operation can inspire many insights on model design for the community in the future. Code is available at: https://github.com/fxmeng/RMNet.
研究の動機と目的
- オンライン推論における残差接続の非効率性(マルチブランチ構造によるもの)を是正すること。
- RepVGG などの再パラメータ化手法が、より深いネットワークにおける残差ブロック内に非線形層が存在する場合にスケーリングに失敗するという制限を克服すること。
- 事前学習済みの ResNet や MobileNetV2 モデルを、精度劣化なしに単一ブランチのシンプルなアーキテクチャに変換できることを実現すること。
- 速度・精度トレードオフの向上と、ネットワーク剪定および高比率のモデル圧縮との相性向上を図ること。
- より深いネットワークにおいても残差接続を除去することで、性能を維持または向上させることの可能性を検証すること。
提案手法
- 残差ブロック内の最初の畳み込み、バッチ正則化、ReLU を用いて入力特徴マップを保持する RM 演算を提案する。
- 保持された入力特徴マップを、残差ブロックの最終畳み込み出力とマージすることで、スキップ接続を効果的に削除する。
- 各残差ブロックに RM 演算を適用し、マルチブランチの残差構造を単一ブランチの VGG フレームワークに変換する。
- リザーブおよびマージ処理におけるパラメータおよび FLOP のオーバーヘッドを最小限に抑えるために、グループ畳み込みとポイントワイド畳み込みを用いる。
- ResNet の初期スタムを、2段の 3×3 畳み込み、BN、ReLU に置き換え、ヘッド部およびブロック構造を同じまま維持することで RMNet を設計する。
- 幅乗数とグループチャネル設定(例:RMNet 50×6_32)を用いて、モデル容量と効率を制御する。
実験結果
リサーチクエスチョン
- RQ1ResNet や MobileNetV2 などの深層ネットワークから、元のモデル出力を変更せずに残差接続を除去できるか?
- RQ2RepVGG などの再パラメータ化手法が、より深いネットワークにスケールしにくい理由は何か?
- RQ3単一ブランチのシンプルなネットワークアーキテクチャが、ResNet や RepVGG を上回る精度・速度トレードオフを達成できるか?
- RQ4残差接続を除去することで、高比率のネットワーク剪定との相性が向上するか?
- RQ5RM 演算は、MobileNetV2 などの他のアーキテクチャにも一般化可能か?
主な発見
- RMNet 50×6_32 は ImageNet で 79.57% のトップ1精度を達成し、推論速度は同等ながら、ResNet-101(77.21%)や RepVGG B2(78.78%)を上回っている。
- RMNet 101×6_16 は ImageNet で 80.07% のトップ1精度を達成した。これは、アーキテクチャ的トリックを用いずに 80% を超える最初のシンプルなモデルである。
- RMNet 152×6_32 は ImageNet で 80.36% のトップ1精度を達成し、RM 演算を用いることで、より深いシンプルなネットワークが依然として有効であることを示している。
- RMNet 26×3_32 は CIFAR-10 で 95.81% の精度を達成し、パラメータ数はわずか 8.8M、FLOPs は 0.51 GFLOPs にとどまり、精度と速度の両面で RepVGG A2 を上回っている。
- RM 演算はポイントワイド畳み込みではパラメータと FLOPs をたった 1/T だけ増加させ、グループ畳み込みではパラメータ効率が非常に高い。
- 残差接続が存在しないため、RMNet は剪定に非常に適しており、精度を落とさずに高比率の圧縮が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。