[论文解读] Disentangled Non-Local Neural Networks
本文提出解耦非局部(DNL)模块,将标准非局部模块中的注意力计算解耦为独立的白化成对项与一元项,以提升特征学习效果。通过使用专用的Softmax函数和嵌入矩阵对这两项进行独立训练,DNL在语义分割、目标检测和动作识别任务中均取得显著性能提升,其中在PASCAL-Context数据集上mIoU最高提升3.4%,在COCO数据集上mAP提升0.7%。
The non-local block is a popular module for strengthening the context modeling ability of a regular convolutional neural network. This paper first studies the non-local block in depth, where we find that its attention computation can be split into two terms, a whitened pairwise term accounting for the relationship between two pixels and a unary term representing the saliency of every pixel. We also observe that the two terms trained alone tend to model different visual clues, e.g. the whitened pairwise term learns within-region relationships while the unary term learns salient boundaries. However, the two terms are tightly coupled in the non-local block, which hinders the learning of each. Based on these findings, we present the disentangled non-local block, where the two terms are decoupled to facilitate learning for both terms. We demonstrate the effectiveness of the decoupled design on various tasks, such as semantic segmentation on Cityscapes, ADE20K and PASCAL Context, object detection on COCO, and action recognition on Kinetics.
研究动机与目标
- 探究非局部模块的内部机制,并识别其注意力计算中的局限性。
- 理解为何在标准非局部模块中,成对项与一元项联合优化时性能表现不佳。
- 通过解耦两项注意力项,实现独立优化,从而提升视觉表征学习能力。
- 在语义分割、目标检测和动作识别等多样化视觉任务中,验证解耦设计的有效性。
提出的方法
- 将非局部模块的注意力计算分解为两项:用于像素间关系建模的白化成对项,以及用于像素显著性建模的一元项。
- 对成对项与一元项分别应用独立的Softmax函数和独立的嵌入矩阵,消除训练过程中两项之间的耦合。
- 将解耦后的组件独立训练,以分析其各自的视觉学习行为。
- 在不改变网络架构的前提下,将标准非局部模块替换为DNL模块,实现直接比较。
- 通过消融实验验证解耦设计对特征学习与模型性能的提升效果。
- 将DNL模块应用于Mask R-CNN和Slow-only等先进模型,用于目标检测与动作识别任务。
实验结果
研究问题
- RQ1当成对项与一元项被单独处理时,它们在视觉表征学习中分别起到何种作用?
- RQ2为何在标准非局部模块中,成对项与一元项的联合优化会阻碍特征学习?
- RQ3解耦这两项是否能促进对区域内部关系与显著边界的更好学习?
- RQ4解耦设计是否能在语义分割、目标检测与动作识别等多样化视觉任务中均提升性能?
主要发现
- 仅使用白化成对项时,能清晰学习到区域内部关系;仅使用一元项时,能清晰学习到显著边界,表明二者提供不同的视觉线索。
- 在标准非局部模块中,当两项耦合时,两者均无法学习到清晰的视觉模式,且模型性能劣于仅使用一元项的变体。
- 在Cityscapes数据集上,使用ResNet-101主干网络时,将标准非局部模块替换为DNL模块,mIoU提升2.0%。
- 在ADE20K数据集上,DNL模块相比标准非局部模块实现1.3%的mIoU提升,仅通过微小修改即达到新的SOTA性能。
- 在PASCAL-Context数据集上,使用ResNet-101主干网络时,DNL模块相比标准非局部模块实现3.4%的mIoU提升。
- 在COCO数据集上,DNL模块相比标准非局部模块实现0.7%更高的bbox mAP与0.6%更高的mask mAP,分别提升0.7%与0.6%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。