Skip to main content
QUICK REVIEW

[論文レビュー] From Discrete to Continuous Convolution Layers

Assaf Shocher, Ben Feinstein|arXiv (Cornell University)|Jun 19, 2020
Advanced Image Processing Techniques参考文献 16被引用数 10
ひとこと要約

この論文は、サブピクセル座標上の連続関数としてフィルタをモデル化する微分可能で一般化された標準的な離散畳み込みとは異なるContinuous Convolution (CC) レイヤーを導入する。従来のレイヤーが整数ステップと固定されたスケール要因に制限されるのに対し、CC レイヤーは任意の空間的サイズへの学習可能で動的な特徴マップのリサイズを可能にし、非整数スケールや軸ごとの異なるスケールを含む。その結果、スケール間でのシフト等長性と一般化性能が向上する。

ABSTRACT

A basic operation in Convolutional Neural Networks (CNNs) is spatial resizing of feature maps. This is done either by strided convolution (donwscaling) or transposed convolution (upscaling). Such operations are limited to a fixed filter moving at predetermined integer steps (strides). Spatial sizes of consecutive layers are related by integer scale factors, predetermined at architectural design, and remain fixed throughout training and inference time. We propose a generalization of the common Conv-layer, from a discrete layer to a Continuous Convolution (CC) Layer. CC Layers naturally extend Conv-layers by representing the filter as a learned continuous function over sub-pixel coordinates. This allows learnable and principled resizing of feature maps, to any size, dynamically and consistently across scales. Once trained, the CC layer can be used to output any scale/size chosen at inference time. The scale can be non-integer and differ between the axes. CC gives rise to new freedoms for architectural design, such as dynamic layer shapes at inference time, or gradual architectures where the size changes by a small factor at each layer. This gives rise to many desired CNN properties, new architectural design capabilities, and useful applications. We further show that current Conv-layers suffer from inherent misalignments, which are ameliorated by CC layers.

研究の動機と目的

  • 標準畳み込みレイヤーの空間的リサイズにおける制限、特に整数スケール要因と固定されたステップに起因する制限を解消すること。
  • ストライド畳み込みに内在する歪みとアリゼーション効果に起因する固有の不整合を克服し、シフト等長性を向上させること。
  • 推論時における動的で学習可能な特徴マップのリサイズを可能にし、非整数スケール要因や軸ごとの異なるスケール要因を含めること。
  • 既存の不規則な点群向け連続畳み込み手法を規則的なグリッドに一般化し、原理的でエンドツーエンドでトレーニング可能なリサイズを可能にすること。
  • CC レイヤーが段階的アーキテクチャーや動的スケールアンサンブルといった新しいアーキテクチャ設計を可能にすることを示すこと。

提案手法

  • 畳み込みフィルタをサブピクセル座標上の学習可能な連続関数として表現し、非整数位置での補間ベースのフィルタリングを可能にする。
  • 連続フィルタを離散入力に適用し、連続的な中間特徴表現を生成する。
  • 任意の希望するサイズの離散出力特徴マップを得るために、微分可能である再サンプリンググリッドを用いて連続表現を再サンプリングする。
  • 出力サイズを推論時に再サンプリンググリッドによって指定することで、連続フィルタを勾配降下法を用いてエンドツーエンドで学習する。
  • 再サンプリングには3次補間を用い、連続フィルタおよび再サンプリングプロセス全体を通じたバックプロパゲーションを実行する。
  • 推論時に同じトレーニング済みCCネットワークに異なるスケールシーケンスを適用し、ログティを平均化することで動的スケールアンサンブルを導入する。

実験結果

リサーチクエスチョン

  • RQ1畳み込みレイヤーを、任意の空間的サイズへの微分可能で学習可能なリサイズを可能にする一般化が可能か?非整数スケール要因を含む。
  • RQ2サブピクセル座標上で畳み込みを連続関数としてモデル化することで、標準的なストライド畳み込みと比較してシフト等長性が向上するか?
  • RQ31つのスケールで訓練されたCCレイヤーが、推論時に複数のスケール要因をカバーできるか?たとえ1つのスケールでしか訓練していない場合でも。
  • RQ4標準畳み込みに内在する入力出力間の不整合は、CCレイヤーによってどの程度軽減されるか?
  • RQ5CCレイヤーは、段階的スケーリングや動的スケールアンサンブルといった、深層ネットワークにおける新しいアーキテクチャパラダイムを可能にできるか?

主な発見

  • CCレイヤーは標準畳み込みと比較して顕著に優れたシフト等長性を達成した。CIFAR-10画像における±4ピクセルのシフトに対して、特徴マップの類似度(コサイン類似度)はベースラインの0.78から0.85に向上した。
  • 1つのスケール(1/2)で訓練されたCCネットワークは他のスケールへの一般化が著しく劣り、100の未学習スケールでテスト誤差が100倍に増加した。これは、一般化のためには明示的なスケール耐性学習が必要であることを示している。
  • 非整数内部スケール要因を用いて訓練されたCCネットワークは、推論時に動的スケールアンサンブルを可能にし、2モデルでCIFAR-10の精度を+1.7%、3モデルで+2.4%向上させた。
  • 最初の実験(1/2スケールで訓練)で学習された連続フィルタは、真値のカーネルに非常に近い形状を示したが、2番目の実験(1つのスケールでのみ訓練)では歪んだカーネルが得られた。これは、スケール耐性学習の必要性を裏付けた。
  • CCレイヤーは、離散的なステップに起因するアリゼーション効果を回避することで、標準畳み込みに内在する固有の不整合を解消し、真のシフト等長性を実現した。
  • CCベースの超解像ネットワークは、1つのトレーニング済みモデルで任意のスケール要因(非整数および軸別スケールを含む)をサポート可能であり、各スケールごとに別々のモデルを用意する必要がなくなる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。