Skip to main content
QUICK REVIEW

[論文レビュー] Scalable and Equivariant Spherical CNNs by Discrete-Continuous (DISCO) Convolutions

Jeremy Ocampo, Matt A. Price|arXiv (Cornell University)|Sep 27, 2022
Medical Imaging and Analysis被引用数 5
ひとこと要約

本稿では、計算スケーラビリティとSO(3)回転等長性の両方を達成する球面CNN向けのDISCO(離散的・連続的)グループ畳み込みを提案する。既存手法の主な限界を解決する。離散的サンプリングとスパーステンソル演算による連続的対称性の保持を組み合わせることで、計算量とメモリ使用量がともに線形にスケーリングされ、高解像度の球面セグメンテーションおよび深度推定ベンチマークにおいて、先行手法を上回る性能を発揮する。

ABSTRACT

No existing spherical convolutional neural network (CNN) framework is both computationally scalable and rotationally equivariant. Continuous approaches capture rotational equivariance but are often prohibitively computationally demanding. Discrete approaches offer more favorable computational performance but at the cost of equivariance. We develop a hybrid discrete-continuous (DISCO) group convolution that is simultaneously equivariant and computationally scalable to high-resolution. While our framework can be applied to any compact group, we specialize to the sphere. Our DISCO spherical convolutions exhibit $ ext{SO}(3)$ rotational equivariance, where $ ext{SO}(n)$ is the special orthogonal group representing rotations in $n$-dimensions. When restricting rotations of the convolution to the quotient space $ ext{SO}(3)/ ext{SO}(2)$ for further computational enhancements, we recover a form of asymptotic $ ext{SO}(3)$ rotational equivariance. Through a sparse tensor implementation we achieve linear scaling in number of pixels on the sphere for both computational cost and memory usage. For 4k spherical images we realize a saving of $10^9$ in computational cost and $10^4$ in memory usage when compared to the most efficient alternative equivariant spherical convolution. We apply the DISCO spherical CNN framework to a number of benchmark dense-prediction problems on the sphere, such as semantic segmentation and depth estimation, on all of which we achieve the state-of-the-art performance.

研究の動機と目的

  • 計算スケーラビリティと回転等長性の両方を備えた球面CNNフレームワークの不足を解消すること。
  • 連続的球面CNNの計算不能性と、離散的アプローチの等長性の失敗を克服すること。
  • 球面データにおける高解像度の密度予測タスク(例:セマンティックセグメンテーション、深度推定)を可能にすること。
  • 球面ピクセル数に比例して線形にスケーリングするスパーステンソルベースの実装を開発すること。
  • 2D3DS、Omni-SYNTHIA、Pano3Dを含むベンチマークで最先端の性能を達成すること。

提案手法

  • SO(3)回転等長性を保持しつつ、効率的な計算を可能にするハイブリッド離散的・連続的(DISCO)グループ畳み込みを導入すること。
  • SO(3)/SO(2)の商空間を用いて球面上のDISCO畳み込みを定義することで、計算コストを低減しつつ、漸近的なSO(3)等長性を維持すること。
  • スパーステンソル表現を用いて、計算コストとメモリ使用量の両方が線形にスケーリングされるフレームワークを実装すること。
  • 高速な球面調和変換とサンプリング定理を活用し、離散グリッドフレームワーク内でも連続的対称性の認識を維持すること。
  • 高解像度の入力と出力をサポートする密度予測タスク向けに、逆畳み込み(トランスポーズDISCO畳み込み)を設計すること。
  • TensorFlowにおけるカスタム勾配を用いて、エンド・ツー・エンドの微分可能性とハードウェア加速(GPU/TPU)互換性を確保すること。

実験結果

リサーチクエスチョン

  • RQ1球面CNNフレームワークが、計算スケーラビリティと正確なSO(3)回転等長性の両方を同時に達成できるか。
  • RQ2球面上の離散的サンプリングと連続的対称性をどのように組み合わせ、計算コストが著しく増大することなく等長性を保持できるか。
  • RQ3DISCOフレームワークがSO(3)/SO(2)の商空間に畳み込みを制限した場合、等長性をどの程度維持できるか。
  • RQ4DISCOフレームワークは、既存の球面CNNと比較して、推論コスト、メモリ使用量、および密度予測タスクにおける性能でどの程度優れているか。
  • RQ5DISCOベースのモデルは、2D3DS、Omni-SYNTHIA、Pano3Dといった高解像度の球面ベンチマークで最先端の性能を達成できるか。

主な発見

  • DISCO球面CNNは、球面ピクセル数に比例して線形にスケーリングされ、SO(3)回転等長性を達成する。最も効率的な先行等長性手法と比較して、計算コストを10^9倍、メモリ使用量を10^4倍削減する。
  • 球面MNISTベンチマークでは、DISCO-Axisymmetricが98.6%のテスト精度を達成し、平面CNN(98.3%)および非等長性離散手法を上回った。
  • 2D3DS屋内360°データセットでは、DISCO-Directional-Augが45.7%のmIoUと62.7%のmAccを達成し、CubeNet(45.0% mIoU)を含むすべての先行手法を上回った。
  • Omni-SYNTHIA屋外データセットでは、DISCO-SeparableとDISCO-Separable-Augがそれぞれ48.3%および49.2%のmIoUを達成し、新たな最先端性能を樹立した。
  • Pano3D深度推定ベンチマークでは、DISCO-Directionalが9つの指標のうち6つをトップクラスにランクした。658kパラメータ(先行最先端モデルの40分の1未満)であり、表面法線の監視を用いていないにもかかわらず、その性能を発揮した。
  • DISCO-Directionalアーキテクチャは、方向に敏感なフィルタと漸近的なSO(3)等長性を備えたため、DISCO-Axisymmetricを上回った性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。