Skip to main content
QUICK REVIEW

[论文解读] FlowFormer: A Transformer Architecture for Optical Flow

Zhaoyang Huang, Xiaoyu Shi|arXiv (Cornell University)|Mar 30, 2022
Advanced Vision and Imaging被引用 16
一句话总结

FlowFormer 提出了一种基于 Transformer 的新型光学流估计架构,通过交替分组自注意力机制将 4D 代价体积编码为紧凑且全局感知的潜在标记,再通过带有动态位置查询的循环 Transformer 解码器生成光学流预测。该方法在 Sintel 数据集(clean pass 上 AEPE 为 1.159)上达到最先进性能,并展现出强大的零样本泛化能力,在未进行 Sintel 微调的情况下,误差降低 15.5%。

ABSTRACT

We introduce optical Flow transFormer, dubbed as FlowFormer, a transformer-based neural network architecture for learning optical flow. FlowFormer tokenizes the 4D cost volume built from an image pair, encodes the cost tokens into a cost memory with alternate-group transformer (AGT) layers in a novel latent space, and decodes the cost memory via a recurrent transformer decoder with dynamic positional cost queries. On the Sintel benchmark, FlowFormer achieves 1.159 and 2.088 average end-point-error (AEPE) on the clean and final pass, a 16.5% and 15.5% error reduction from the best published result (1.388 and 2.47). Besides, FlowFormer also achieves strong generalization performance. Without being trained on Sintel, FlowFormer achieves 1.01 AEPE on the clean pass of Sintel training set, outperforming the best published result (1.29) by 21.7%.

研究动机与目标

  • 设计一种基于 Transformer 的光学流网络,有效利用先前方法中已建立的代价体积表示。
  • 通过引入紧凑高效的标记化与注意力机制,克服将标准 Transformer 直接应用于 4D 代价体积的计算不可行性。
  • 通过一种新颖的交替分组注意力机制建模代价特征中的长距离依赖关系,从而提升光学流估计的准确率与泛化能力。
  • 证明将 Transformer 与代价体积结合(而非处理原始像素)可带来更优性能与更高的参数效率。

提出的方法

  • 将 4D 代价体积中的每个 2D 代价图划分为补丁,然后将每个补丁投影为 K 个潜在标记,从而将 4D 体积压缩为 H×W×K 个标记。
  • 采用交替分组 Transformer(AGT)层,交替在相同源像素的代价图内及不同源像素之间应用自注意力,实现全局上下文建模。
  • 由 AGT 层生成的代价记忆是完整代价体积的紧凑且全局感知的表示,保留了关键的流相关信息。
  • 循环 Transformer 解码器使用基于当前流估计动态更新的动态位置代价查询,以引导对代价记忆的交叉注意力。
  • 解码器使用共享的门控循环单元(GRU)头,迭代回归流残差,通过逐步优化提升流估计精度。
  • 图像特征编码器可选择性地替换为 ImageNet 预训练的视觉 Transformer(Twins-SVT),相比标准 CNN 可进一步提升性能。

实验结果

研究问题

  • RQ1基于 Transformer 的架构能否在保持计算效率的前提下,有效处理用于光学流估计的 4D 代价体积?
  • RQ2通过新型注意力机制建模代价特征中的长距离依赖关系,是否能相比局部窗口方法提升光学流估计的准确率?
  • RQ3代价体积的紧凑潜在表示是否能保留足够的信息以实现准确的流预测,从而减少对大规模参数化的依赖?
  • RQ4与先前方法相比,将 Transformer 与代价体积结合是否能带来更好的跨数据集零样本泛化能力?

主要发现

  • 在 Sintel clean pass 上,FlowFormer 实现了 1.159 的平均端点误差(AEPE),相比之前最佳结果(1.388)降低了 16.5%。
  • 在 Sintel final pass 上,FlowFormer 实现了 2.088 的 AEPE,相比之前最先进方法(2.47)降低了 15.5%。
  • 在未对 Sintel 进行任何微调的情况下,FlowFormer 在 Sintel clean pass 上实现了 1.01 的 AEPE,相比最佳已发表结果(1.29)降低了 21.7%。
  • 即使采用更小的配置(K=4, D=32, AGT×1),FlowFormer 在所有指标上仍优于 GMA,证明其架构优越性不仅体现在参数量上。
  • 将 GMA 的 CNN 编码器替换为与 FlowFormer 相同的 ImageNet 预训练 Twins-SVT 后,Sintel clean 上仅实现 15% 的误差降低,而 FlowFormer 仍保持 15% 的更低误差,证明其设计更具有效性。
  • 消融实验确认 AGT 层与代价记忆表示显著提升性能,随着 AGT 层数量从 0 增加到 3,AEPE 持续下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。