Skip to main content
QUICK REVIEW

[論文レビュー] RotDCF: Decomposition of Convolutional Filters for Rotation-Equivariant Deep Networks

Xiuyuan Cheng, Qiang Qiu|arXiv (Cornell University)|May 17, 2018
Medical Imaging and Analysis被引用数 15
ひとこと要約

本稿では、空間的および回転的ドメインにおける共同可動基底を用いて畳み込みフィルタを分解する回転等長性畳み込みニューラルネットワーク「RotDCF」を提案する。この手法により、モデルサイズと計算コストを顕著に削減するとともに、フィルタの暗黙的正則化が可能となる。本手法は、平面内および平面外回転下における顔認識タスクにおいて、知られている被験者では97.04%、平面外回転下では89.66%の精度を達成し、最先端のロバスト性と解釈可能性を実現した。

ABSTRACT

Explicit encoding of group actions in deep features makes it possible for convolutional neural networks (CNNs) to handle global deformations of images, which is critical to success in many vision tasks. This paper proposes to decompose the convolutional filters over joint steerable bases across the space and the group geometry simultaneously, namely a rotation-equivariant CNN with decomposed convolutional filters (RotDCF). This decomposition facilitates computing the joint convolution, which is proved to be necessary for the group equivariance. It significantly reduces the model size and computational complexity while preserving performance, and truncation of the bases expansion serves implicitly to regularize the filters. On datasets involving in-plane and out-of-plane object rotations, RotDCF deep features demonstrate greater robustness and interpretability than regular CNNs. The stability of the equivariant representation to input variations is also proved theoretically under generic assumptions on the filters in the decomposed form. The RotDCF framework can be extended to groups other than rotations, providing a general approach which achieves both group equivariance and representation stability at a reduced model size.

研究の動機と目的

  • 群等長性畳み込みニューラルネットワークにおける、特に回転に対する高い計算コストおよびパラメータコストを軽減すること。
  • 平面内および平面外のオブジェクト回転下における深層特徴のロバスト性と解釈可能性を向上させること。
  • 回転等長性ネットワークにおける入力変形に対する表現安定性に関する理論的保証を提供すること。
  • 性能を損なわずに、パラメータ削減と暗黙的正則化を実現する効率的かつ低ランクなフィルタ分解を可能とすること。
  • SO(2)を越える他のコンact Lie群へも、統一的な分解アプローチによりフレームワークを一般化すること。

提案手法

  • 本手法は、空間領域および回転群SO(2)において、それぞれジョイントフーリエ・ベッセル基底およびフーリエ基底を用いて畳み込みフィルタを切断展開として表現する。
  • ℝ²およびSO(2)上の結合畳み込みを定式化することで、可動基底を用いた回転等長性を実現する。
  • フィルタ係数はデータから学習されるが、基底(ψₖ(u)φₘ(α))は固定されるため、パラメータ削減と暗黙的正則化が可能となる。
  • 特徴マップを群インデックス付きチャネルとして表現する修正されたネットワークアーキテクチャを採用し、回転方向を符号化する。
  • 推論時に円形シフトアラインメントを適用することで、回転等長性を活用し、認識精度を向上させる。
  • 理論的分析により、一般的なフィルタ条件の下で、入力変形に対する等長表現の安定性が保証されることを示した。

実験結果

リサーチクエスチョン

  • RQ1ジョイント空間的および回転的基底におけるフィルタ分解は、性能を損なわずに回転等長性畳み込みニューラルネットワークのモデル複雑度を低減できるか?
  • RQ2RotDCFにおける切断基底展開は、フィルタを暗黙的に正則化し、回転変動に対するロバスト性を向上させるか?
  • RQ3平面内および平面外回転下において、RotDCFは標準畳み込みニューラルネットワークと比較して、表現安定性と解釈可能性をどの程度向上させるか?
  • RQ4現実的な回転シナリオ下で、等長表現の理論的安定性保証が実証的に検証可能か?
  • RQ5RotDCFフレームワークは、SO(2)を越える他のコンパクトLie群へ一般化可能か?

主な発見

  • 特徴アラインメントを適用した結果、RotDCFは平面内回転下で知られている被験者では97.04%、未知の被験者では97.58%の認識精度を達成した。一方、標準畳み込みニューラルネットワークはそれぞれ0.54%および5.05%にとどまった。
  • 平面外回転下では、RotDCFは知られている被験者で89.66%、未知の被験者で97.01%の精度を示した。これに対して、標準畳み込みニューラルネットワークは80.79%および89.97%であった。
  • クラスアクティベーションマップ(CAM)の結果、RotDCFは回転画像間でより一貫した判別的領域を選択しており、優れた表現安定性を示していることが明らかになった。
  • 分解によりモデルサイズと計算複雑度が削減された一方で、性能は維持されており、切断による精度低下も最小限に抑えられた。
  • 理論的分析により、分解されたフィルタ形式が一般的な仮定の下で、入力変形に対する等長表現の安定性を保証することが確認された。
  • 球面調和関数などの適切な基底を選択することで、SO(3)などの他の群に対しても、同様のフレームワークを一般化可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。