Skip to main content
QUICK REVIEW

[论文解读] Boundary Attention: Learning curves, corners, junctions and grouping

Mia Gaia Polansky, Charles Herrmann|arXiv (Cornell University)|Jan 1, 2024
Machine Learning and Algorithms被引用 4
一句话总结

本文提出边界注意力(Boundary Attention),一种可微分的深度学习机制,通过在图像块上自适应地进行局部注意力操作,显式建模几何边界(如曲线、角点和交汇点)。该模型实现了亚像素级精度,并在高噪声环境下表现出强鲁棒性,能从简单的合成数据泛化到真实世界图像,原生支持任意分辨率处理,且推理速度比以往方法快数个数量级。

ABSTRACT

We present a lightweight network that infers grouping and boundaries, including curves, corners and junctions. It operates in a bottom-up fashion, analogous to classical methods for sub-pixel edge localization and edge-linking, but with a higher-dimensional representation of local boundary structure, and notions of local scale and spatial consistency that are learned instead of designed. Our network uses a mechanism that we call boundary attention: a geometry-aware local attention operation that, when applied densely and repeatedly, progressively refines a pixel-resolution field of variables that specify the boundary structure in every overlapping patch within an image. Unlike many edge detectors that produce rasterized binary edge maps, our model provides a rich, unrasterized representation of the geometric structure in every local region. We find that its intentional geometric bias allows it to be trained on simple synthetic shapes and then generalize to extracting boundaries from noisy low-light photographs.

研究动机与目标

  • 解决在高噪声环境下以亚像素精度和几何一致性检测微弱边界的挑战。
  • 开发一种可微分、端到端可训练的模型,显式地对边缘、角点和交汇点等几何基元进行推理。
  • 实现在原始分辨率和宽高比下处理图像,无需下采样或步幅操作。
  • 在经典方法和深度学习方法常失效的极端噪声条件下,实现鲁棒性能。
  • 从简单的合成数据(如带噪声的随机彩色形状)有效泛化到复杂的现实世界图像。

提出的方法

  • 核心机制为边界注意力:一种局部、可微分的注意力操作,用于在每个图像块上精细化调整几何基元场。
  • 每个块标记(token)编码一个自适应大小的几何基元(边缘、角点、交汇点),表示局部边界结构。
  • 模型使用参数化嵌入空间表示交汇点,支持平滑插值与空间一致性。
  • 输出为重叠的几何基元场,可直接用于边界感知平滑和无符号距离图生成。
  • 模型在合成数据上进行训练,数据由均匀着色的随机圆形和三角形构成,并添加高斯噪声。
  • 所有组件均为局部且平移不变,训练后可部署于任意尺寸或分辨率的图像。

实验结果

研究问题

  • RQ1可微分深度学习模型是否能在高噪声环境中以亚像素精度检测微弱边界?
  • RQ2此类模型是否能在无需微调的情况下,从简单合成数据泛化到复杂真实图像?
  • RQ3与标准光栅化边缘检测相比,显式建模几何基元(边缘、角点、交汇点)是否能提升对噪声的鲁棒性?
  • RQ4模型是否能原生处理图像的原始分辨率和宽高比,而无需下采样或步幅操作?
  • RQ5与最先进方法(如Field of Junctions和EDTER)相比,该模型在性能和效率上表现如何?

主要发现

  • 在所有匹配阈值下,模型在噪声输入上均取得高F值,表明在极端传感器噪声下仍具强鲁棒性。
  • 即使在低光照和高噪声条件下,模型也能从SIDD数据集中的真实图像中有效泛化,生成清晰、定义明确的边界。
  • 模型推理速度比Field of Junctions(FoJ)快10至100倍,A100 GPU上125×125图像的推理时间为0.0823秒,320×320图像为0.678秒。
  • 尽管仅含207k参数,该模型在高噪声条件下的边界检测精度仍优于EDTER和FoJ等最先进方法。
  • 学习到的交汇点嵌入空间平滑且可解释,线性插值可生成不同交汇类型之间的自然过渡。
  • 模型的隐藏状态学习到一个空间平滑的交汇点流形,表明其对几何结构具有有效的内部表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。