[论文解读] Rethinking Learnable Tree Filter for Generic Feature Transform
该论文提出可学习树滤波器V2(LTF-V2),一种可微分、可学习的树滤波模块,通过引入可学习的单变量项和可微分的生成树算法,放宽了先前方法的几何约束。该方法在保持结构细节的同时实现了有效的长距离特征交互,在Cityscapes语义分割任务上实现了82.1%的mIoU,计算复杂度为线性且计算开销极低。
The Learnable Tree Filter presents a remarkable approach to model structure-preserving relations for semantic segmentation. Nevertheless, the intrinsic geometric constraint forces it to focus on the regions with close spatial distance, hindering the effective long-range interactions. To relax the geometric constraint, we give the analysis by reformulating it as a Markov Random Field and introduce a learnable unary term. Besides, we propose a learnable spanning tree algorithm to replace the original non-differentiable one, which further improves the flexibility and robustness. With the above improvements, our method can better capture long-range dependencies and preserve structural details with linear complexity, which is extended to several vision tasks for more generic feature transform. Extensive experiments on object detection/instance segmentation demonstrate the consistent improvements over the original version. For semantic segmentation, we achieve leading performance (82.1% mIoU) on the Cityscapes benchmark without bells-and-whistles. Code is available at https://github.com/StevenGrove/LearnableTreeFilterV2.
研究动机与目标
- 为解决原始可学习树滤波器(LTF-V1)因几何约束刚性而难以建模长距离依赖的问题。
- 克服LTF-V1中生成树构建过程的不可微性,从而提升端到端训练能力和鲁棒性。
- 通过将树滤波器重新表述为带有可学习单变量项的马尔可夫随机场(MRF),实现更灵活、更有效的特征聚合。
- 开发一种可微分的生成树算法,使梯度能够通过树结构构建过程流动。
- 将树滤波器的适用范围扩展到语义分割之外的通用视觉任务,包括目标检测和实例分割。
提出的方法
- 将LTF-V1重新表述为马尔可夫随机场(MRF),以实现对长距离依赖关系的合理建模。
- 引入可学习的单变量项,调节每个节点的影响,使滤波器能够聚焦于远距离但语义相关的区域,而不仅限于空间邻近区域。
- 提出一种可学习的生成树(LST)算法,替代LTF-V1中不可微分的最小生成树,从而支持端到端训练。
- 通过使用基于树的结构进行特征聚合,保持线性计算复杂度,确保高效性。
- 在ResNet-50和ResNet-101等主干网络中集成LTF-V2模块,仅需极少的架构修改。
- 在解码器中使用全局平均池化和残差块,进一步增强特征表示,遵循LTF-V1的设计。
实验结果
研究问题
- RQ1如何放宽原始可学习树滤波器中的几何约束,以实现有效的长距离特征交互?
- RQ2可微分的生成树构建过程是否能提升基于树的特征聚合的鲁棒性和端到端可训练性?
- RQ3引入可学习的单变量项在多大程度上增强了滤波器对语义相关远距离区域的关注能力?
- RQ4LTF-V2模块在包括目标检测、实例分割和语义分割在内的多种视觉任务中表现如何?
- RQ5LTF-V2是否能在极低计算和参数开销下实现最先进性能?
主要发现
- LTF-V2模块在Cityscapes测试集上实现了82.1%的mIoU,无需额外技巧,创下仅使用精细标注的模型新SOTA记录。
- 在COCO实例分割任务中,LTF-V2相比ResNet-50-FPN基线模型,AP^box和AP^seg分别提升了2.4%和1.8%的绝对值。
- 消融实验表明,可学习的单变量项和可学习的生成树算法均对性能有显著贡献,全量LTF-V2模型在使用多尺度和翻转增强时,相比LTF-V1在Cityscapes上提升了3.4%的mIoU。
- LTF-V2模块保持了线性计算复杂度,并表现出可忽略的计算开销,使其在实际部署中极具效率。
- 该方法在多个任务中均实现了一致的性能提升,包括目标检测和实例分割,证明了其通用适用性。
- 可学习的单变量项使滤波器能够关注远距离但语义相关的区域,如图1所示的可视化结果,成功克服了LTF-V1对空间邻近性的偏好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。