[論文レビュー] Dilated convolution with learnable spacings
本稿では、穴あき畳み込みにおける非ゼロカーネル要素の位置を補間を用いて微分可能にすることで、パラメータ数を増やさずに受容 field を拡大できる、学習可能な間隔を有する拡張畳み込み(DCLS)を提案する。DCLS は、パラメータ数や計算コストをほとんど増やさずに ImageNet-1K の精度と下流タスク性能を向上させ、標準的および固定間隔の畳み込みを凌駆する。
Recent works indicate that convolutional neural networks (CNN) need large receptive fields (RF) to compete with visual transformers and their attention mechanism. In CNNs, RFs can simply be enlarged by increasing the convolution kernel sizes. Yet the number of trainable parameters, which scales quadratically with the kernel's size in the 2D case, rapidly becomes prohibitive, and the training is notoriously difficult. This paper presents a new method to increase the RF size without increasing the number of parameters. The dilated convolution (DC) has already been proposed for the same purpose. DC can be seen as a convolution with a kernel that contains only a few non-zero elements placed on a regular grid. Here we present a new version of the DC in which the spacings between the non-zero elements, or equivalently their positions, are no longer fixed but learnable via backpropagation thanks to an interpolation technique. We call this method "Dilated Convolution with Learnable Spacings" (DCLS) and generalize it to the n-dimensional convolution case. However, our main focus here will be on the 2D case. We first tried our approach on ResNet50: we drop-in replaced the standard convolutions with DCLS ones, which increased the accuracy of ImageNet1k classification at iso-parameters, but at the expense of the throughput. Next, we used the recent ConvNeXt state-of-the-art convolutional architecture and drop-in replaced the depthwise convolutions with DCLS ones. This not only increased the accuracy of ImageNet1k classification but also of typical downstream and robustness tasks, again at iso-parameters but this time with negligible cost on throughput, as ConvNeXt uses separable convolutions. Conversely, classic DC led to poor performance with both ResNet50 and ConvNeXt. The code of the method is available at: https://github.com/K-H-Ismail/Dilated-Convolution-with-Learnable-Spacings-PyTorch.
研究の動機と目的
- 標準的な穴あき畳み込みにおける固定で規則的なグリッド間隔の制限を解消し、受容 field の最適化を可能にする。
- 離散的な位置の非微分性を克服し、畳み込みにおける非ゼロカーネル要素の位置を勾配ベースで学習可能にする。
- モデルのパラメータ数や計算コストを増やさずに、画像分類および耐障害性タスクの性能を向上させる。
- 特に深度可分畳み込みを用いた現代の CNN(例:ConvNeXt)において、DCLS が即座に組み込める代替手段として有効であるかを評価する。
- ImageNet-1k などの大規模ビジョンベンチマークにおける DCLS のスケーラビリティと有効性を検討する。
提案手法
- DCLS は双線形補間を用いて、非ゼロカーネル要素の離散的位置を微分可能にし、エンドツーエンドのバックプロパゲーションを可能にする。
- カーネル位置を連続的なオフセットとしてパrameter化し、訓練中に最適化しながらもスパarsityを維持する。
- 1D、2D、3D、および混合次元(例:2-1D、3-2D)畳み込みへ一般化可能で、コンピュータビジョンの文脈では主に2Dに焦点を当てる。
- カーネル重みと位置を同時に最適化し、チャネルおよび空間的位置間で位置を共有することで過学習を軽減する。
- 効率的な実装(例:深度可分インプリシット GEMM)と互換性があり、スループットのオーバーヘッドを最小限に抑える。
- 入力依存のメカニズム(例:可変畳み込み)を回避し、入力に依存せず安定した動作を維持する。
実験結果
リサーチクエスチョン
- RQ1穴あき畳み込みにおける非ゼロ要素の位置を学習することで、受容 field の効率性とモデル精度が向上するか?
- RQ2同じパラメータ数のもとで、DCLS は標準的および固定間隔畳み込みを上回る性能を画像分類および下流タスクで示せるか?
- RQ3DCLS は、特に深度可分畳み込みを用いた現代の CNN(例:ConvNeXt)において、顕著なスループット低下を伴わずに即座に組み込める代替手段として有効か?
- RQ4位置共有と補間は、DCLS の訓練安定性および性能にどのように影響するか?
- RQ5DCLS は ImageNet-1k や耐障害性ベンチマークといった大規模ベンチマークで有効であるか?
主な発見
- DCLS は、深度可分畳み込みを置き換えることで、ConvNeXt における ImageNet-1K のトップ-1精度を向上させ、スループットへの影響はほとんどなかった。
- ResNet50 では、DCLS は同パラメータ数のもとで精度を向上させたが、スループットのペナルティを伴った。これは ConvNeXt とは対照的であった。
- 標準的な穴あき畳み込みは、ResNet50 および ConvNeXt の両方で性能向上に失敗しており、その剛性が性能を制限していることが示された。
- DCLS は、訓練の不安定性と高遅延を引き起こす可変畳み込み v2 よりも、ConvNeXt で優れた性能を示した。
- DCLS は、分類を越えて下流タスクおよび耐障害性タスクにおいて一貫した向上を示し、分類以外の応用分野への広がりが期待される。
- ステージ内での位置共有が、DCLS の安定的かつ効果的な訓練に不可欠であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。