[论文解读] Feature Pyramid Transformer
本文提出特征金字塔Transformer(FPT),一种基于自注意力机制的新模块,通过显式建模空间与尺度维度上的非局部跨尺度交互,增强特征金字塔。通过整合自级别、自顶向下和自底向上三种Transformer,FPT在计算开销极小的情况下提升了目标检测与语义分割性能,在多个基准测试中实现了1.6–1.8%的SOTA mIoU提升。
Feature interactions across space and scales underpin modern visual recognition systems because they introduce beneficial visual contexts. Conventionally, spatial contexts are passively hidden in the CNN's increasing receptive fields or actively encoded by non-local convolution. Yet, the non-local spatial interactions are not across scales, and thus they fail to capture the non-local contexts of objects (or parts) residing in different scales. To this end, we propose a fully active feature interaction across both space and scales, called Feature Pyramid Transformer (FPT). It transforms any feature pyramid into another feature pyramid of the same size but with richer contexts, by using three specially designed transformers in self-level, top-down, and bottom-up interaction fashion. FPT serves as a generic visual backbone with fair computational overhead. We conduct extensive experiments in both instance-level (i.e., object detection and instance segmentation) and pixel-level segmentation tasks, using various backbones and head networks, and observe consistent improvement over all the baselines and the state-of-the-art methods.
研究动机与目标
- 解决现有方法在捕捉特征金字塔中非局部、跨尺度视觉上下文方面的局限性。
- 设计一种通用、即插即用的主干网络,主动建模超越传统CNN的空间与尺度感知特征交互。
- 通过更丰富的上下文特征表示,提升实例级(目标检测、实例分割)与像素级(语义分割)任务的性能。
- 在显著提升特征表示质量的同时,保持计算效率,适用于多样化视觉识别任务。
提出的方法
- 提出特征金字塔Transformer(FPT),将输入特征金字塔转换为相同尺寸但上下文信息更丰富的增强型特征金字塔。
- 引入三种专用Transformer:自注意力Transformer(ST)用于层内空间交互,局部-全局Transformer(LGT)用于自顶向下的尺度感知交互,表示Transformer(RT)用于自底向上的尺度感知交互。
- 采用多头自注意力机制,结合可学习查询、键和值,显式建模跨空间与尺度的长程非局部依赖关系。
- 在整个过程中保持特征图分辨率与尺寸不变,实现与现有检测与分割头的无缝集成。
- 采用轻量化设计,控制FLOPs与参数量的增加(例如,LGT的参数量增加0.44×,GFLOPs增加0.10×),确保计算开销合理。
- 将FPT作为通用模块应用于多种主干网络(如ResNet-101)与特征金字塔架构(UFP、PPM、ASPP),验证其广泛兼容性。
实验结果
研究问题
- RQ1显式建模跨尺度特征交互是否能超越传统基于CNN或仅关注空间非局部性的方法,提升视觉识别性能?
- RQ2自注意力机制如何被适配以建模不仅跨越空间,还跨越不同特征金字塔层级的非局部交互?
- RQ3与SOTA方法相比,FPT在实例级与像素级分割任务中的性能提升程度如何?
- RQ4FPT是否能在显著增强特征表示质量的同时,保持高效率,适用于多样化的基准与主干网络架构?
主要发现
- 在Cityscapes、ADE20K、LIP和PASCAL VOC 2012等多个数据集上,FPT实现了SOTA性能,相较于使用相同ResNet-101主干的SOTA方法,mIoU分别提升了1.6%、1.2%、1.7%和1.8%。
- 消融实验表明,三种Transformer(ST、LGT、RT)联合使用时性能最佳,在Cityscapes上较UFP基线mIoU提升2.6%。
- 仅使用自注意力Transformer(ST)即可使验证mIoU相比UFP提升1.6%,证明层内非局部交互的有效性。
- 在Cityscapes、ADE20K、LIP和PASCAL VOC 2012上,FPT分别优于SOTA方法OCNet 0.9%、1.1%、1.3%和0.8%的mIoU。
- 定性结果表明,FPT在边界预测精度以及小尺寸与细长物体(如护栏、人的腿部)的分割效果上,优于基线模型与OCNet。
- 模型保持了合理的计算成本,与UFP基线相比,参数量最多增加0.44×,GFLOPs最多增加0.10×。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。