Skip to main content
QUICK REVIEW

[论文解读] Clebsch-Gordan Nets: a Fully Fourier Space Spherical Convolutional Neural Network

Risi Kondor, Zhen Lin|arXiv (Cornell University)|Jun 24, 2018
Seismic Imaging and Inversion Techniques被引用 60
一句话总结

这篇论文通过在傅里叶空间使用 Clebsch–Gordan 基于的非线性来推广球面对卷积神经网络,使网络在完全傅里叶空间中实现旋转等变性网络,取得具有竞争力的结果并减少变换次数。

ABSTRACT

Recent work by Cohen \\emph{et al.} has achieved state-of-the-art results for learning spherical images in a rotation invariant way by using ideas from group representation theory and noncommutative harmonic analysis. In this paper we propose a generalization of this work that generally exhibits improved performace, but from an implementation point of view is actually simpler. An unusual feature of the proposed architecture is that it uses the Clebsch--Gordan transform as its only source of nonlinearity, thus avoiding repeated forward and backward Fourier transforms. The underlying ideas of the paper generalize to constructing neural networks that are invariant to the action of other compact groups.

研究动机与目标

  • 在球面数据上推动具备精确旋转不变性的学习,并推广到其他紧致群。
  • 开发一个完全在傅里叶空间中的神经网络,避免重复的前向/反向傅里叶变换。
  • 引入基于 Clebsch–Gordan 的非线性作为网络中唯一的非线性。
  • 在 SO(3) 下提供协变性保证并展示经验性能。
  • 控制通道增长以在保持表达能力的同时维持可处理的模型规模。

提出的方法

  • 将激活表示为跨不可约表示的 SO(3) 共变向量(片段)。
  • 对每个角频 ℓ 使用协变线性变换 Gℓ = Fℓ · Wℓ(命题 2)。
  • 引入一个非线性 Clebsch–Gordan 变换,通过张量积和 CG 分解将片段组合以产生协变输出(引理 3)。
  • 合并所有 (ℓ1, ℓ2) 对的 CG 输出,并应用一个学习到的线性变换以限制每层的片段数量 (τℓ)。
  • 保持最终的不变层,从 ℓ=0 分量输出 SO(3) 不变的标量。
  • 给出端到端的前向传递描述,包含初始球谐变换、随后是 S−1 CG+线性层,以及一个不变的最终层。

实验结果

研究问题

  • RQ1一个 SO(3)-共变网络是否可以在不做来回傅里叶变换的情况下实现精确的旋转不变性。
  • RQ2基于 Clebsch–Gordan 分解的全傅里叶空间非线性运算是否能优于以往的球面 CNN 的性能?
  • RQ3网络在 CG 非线性后如何管理通道的组合增长,同时保持效率?
  • RQ4Clebsch–Gordan 网络在推广到 SO(3) 之外的其他紧致群上能达到怎样的程度?

主要发现

  • 在球面上旋转的 MNIST 上,所提出的方法在 NR/NR、NR/R、R/R 的准确率分别达到 96.4%、96%、96.6%,超过 Cohen 等人(95.59、94.62、93.4)和基线 CNN(97.67、22.18、12)。
  • 该方法在各种旋转下维持高精度,表明相较于以往工作中的离散化方法,其等变性保持更好。
  • 该方法通过完全在傅里叶空间中运算,减少了大量前向/反向变换,同时在有限精度之内保证了精确的旋转协变性。
  • 该架构使用二次 Clebsch–Gordan 非线性,未来可扩展到更高阶 CG 幂,在傅里叶空间实现有效的特征融合。
  • 设计中包含一个在 CG 组合后通过学习的线性降维阶段来限制每层的通道增长,以保持模型的可处理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。