[论文解读] High-Resolution Optical Flow from 1D Attention and Correlation
该论文提出Flow1D,一种基于1D注意力与相关性的新型1D注意力和相关性融合的代价体积构建方法,用于高分辨率光流估计。通过将二维对应匹配分解为正交的1D注意力与相关性操作,将计算复杂度从O(H²W²)降低至O(HW(H+W)),在保持Sintel和KITTI基准测试中具有竞争力的精度的同时,实现了8K分辨率图像的高效推理,内存消耗比RAFT低6倍。
Optical flow is inherently a 2D search problem, and thus the computational complexity grows quadratically with respect to the search window, making large displacements matching infeasible for high-resolution images. In this paper, we take inspiration from Transformers and propose a new method for high-resolution optical flow estimation with significantly less computation. Specifically, a 1D attention operation is first applied in the vertical direction of the target image, and then a simple 1D correlation in the horizontal direction of the attended image is able to achieve 2D correspondence modeling effect. The directions of attention and correlation can also be exchanged, resulting in two 3D cost volumes that are concatenated for optical flow estimation. The novel 1D formulation empowers our method to scale to very high-resolution input images while maintaining competitive performance. Extensive experiments on Sintel, KITTI and real-world 4K ($2160 imes 3840$) resolution images demonstrated the effectiveness and superiority of our proposed method. Code and models are available at \url{https://github.com/haofeixu/flow1d}.
研究动机与目标
- 解决当前先进光流方法(如RAFT)中4D代价体积的二次方计算复杂度问题,该问题限制了其在高分辨率输入下的可扩展性。
- 克服现有4D代价体积构建方法在处理4K和8K等高分辨率图像时的低效性与内存限制。
- 开发一种紧凑高效的代价体积公式,保持竞争力的精度,同时实现在超高清视频上的实时推理。
- 通过降低内存与计算量,而不牺牲关键对应关系建模能力,实现消费级高清视频的实际光流估计。
提出的方法
- 在目标图像特征图上垂直应用1D注意力机制,以在行之间传播长距离依赖关系。
- 在经过注意力处理的特征上水平应用1D相关性,构建一个建模水平对应关系的3D代价体积,有效模拟2D匹配。
- 反转注意力与相关性的方向,生成第二个3D代价体积,随后与第一个代价体积拼接,实现完整的2D对应关系建模。
- 构建两个大小为H×W×W和H×W×H的3D代价体积,与标准4D相关性相比,整体复杂度从O(H²W²)降低至O(HW(H+W))。
- 将所得紧凑的代价体积作为输入,送入光流头网络,实现端到端的光流回归。
- 借鉴Transformer中的自注意力与交叉注意力机制,增强1D公式中的特征传播与匹配精度。

实验结果
研究问题
- RQ1能否在不造成显著精度损失的前提下,将2D光流对应关系建模有效分解为正交的1D操作?
- RQ21D注意力与相关性是否能在显著降低计算成本的同时,实现与标准基准测试相当的性能?
- RQ3与现有4D代价体积方法相比,该方法在超高清图像(如4K和8K)上的可扩展性如何?
- RQ4在高分辨率输入下,该方法与当前最先进模型(如RAFT)相比,在内存效率与推理速度方面表现如何?
主要发现
- 在Sintel测试集上,Flow1D取得第二好的性能,最终端点误差为1.25,仅略逊于RAFT(1.27),优于PWC-Net+(2.34)。
- 在KITTI 2015基准上,Flow1D的F1-all得分为6.27,优于PWC-Net+(7.72),接近MaskFlowNet(6.10),但仍略逊于RAFT(5.10)。
- 在1080p分辨率下,Flow1D的内存消耗仅为RAFT的1/6,且由于代价体积计算量减少,推理速度显著更快。
- Flow1D成功处理了4K(2160×3840)分辨率图像,仅消耗5.8GB内存,而RAFT因内存溢出而失败。
- 该方法可扩展至8K分辨率(4320×7680),内存消耗为21.81GB,展现出超越当前最先进方法的强大可扩展性。
- 在DAVIS 1080p与4K数据集上的视觉对比显示,Flow1D的结果与RAFT相当,几乎无可见伪影,且结构一致性强。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。