[论文解读] Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation
本文提出了一种带有协同注意力嵌入(Co-Attention Embedding)的编码器融合网络(CEFNet),用于指代图像分割任务。该方法在编码器阶段而非解码器阶段执行跨模态融合,从而实现语言引导的、渐进式的多尺度视觉特征优化。该方法采用协同注意力机制,以并行方式联合更新视觉与语言特征,提升语义对齐效果,并引入边界增强模块(BEM),使IoU性能提升2–3%,在四个基准数据集上实现最先进(SOTA)性能,且无需后处理。
Recently, referring image segmentation has aroused widespread interest. Previous methods perform the multi-modal fusion between language and vision at the decoding side of the network. And, linguistic feature interacts with visual feature of each scale separately, which ignores the continuous guidance of language to multi-scale visual features. In this work, we propose an encoder fusion network (EFN), which transforms the visual encoder into a multi-modal feature learning network, and uses language to refine the multi-modal features progressively. Moreover, a co-attention mechanism is embedded in the EFN to realize the parallel update of multi-modal features, which can promote the consistent of the cross-modal information representation in the semantic space. Finally, we propose a boundary enhancement module (BEM) to make the network pay more attention to the fine structure. The experiment results on four benchmark datasets demonstrate that the proposed approach achieves the state-of-the-art performance under different evaluation metrics without any post-processing.
研究动机与目标
- 解决指代图像分割中解码器侧融合的局限性,该方法无法持续地为多尺度视觉特征提供语言引导。
- 通过将顺序模态更新替换为并行协同注意力机制,改善跨模态对齐,提升视觉与语言表征之间的语义一致性。
- 恢复特征提取过程中丢失的细粒度结构细节,尤其是在目标边界附近。
- 在不引入后处理或额外计算成本的前提下,实现最先进性能。
提出的方法
- 将视觉编码器(如ResNet)转换为多模态特征编码器,实现在编码器阶段对语言与视觉特征进行深度融合。
- 引入一种协同注意力机制,通过共享的亲和矩阵同时更新视觉与语言特征,促进联合表征学习。
- 采用两种协同注意力变体:标准协同注意力与非对称协同注意力,后者可提升模态特异性上下文理解能力。
- 集成边界增强模块(BEM),利用边缘线索在解码阶段优化分割掩码,提升轮廓精度。
- 在解码器中使用特征金字塔网络(FPN)实现多尺度预测,融合操作通过逐元素拼接(公式1)在编码器与解码器基线中实现。
- 通过消融实验对比编码器融合(EFN)与解码器融合(DFN),证明了编码器级融合的优越性。
实验结果
研究问题
- RQ1与解码器侧融合相比,编码器阶段的多模态融合是否能更有效地提升语言引导的特征学习?
- RQ2并行协同注意力机制是否比顺序注意力更有效地增强跨模态对齐与表征一致性?
- RQ3显式边界细化是否能提升细粒度目标轮廓的分割精度?
- RQ4在性能与推理效率方面,所提方法相较于最先进方法表现如何?
主要发现
- 编码器融合网络(EFN)显著优于解码器融合基线(DFN),证明了早期融合可在不增加计算成本的前提下实现更优的特征学习。
- 标准协同注意力模块在UNC-val、UNC-testA与UNC-testB数据集上使平均IoU提升6.8%至8.2%;非对称协同注意力模块则实现7.6%至8.8%的提升。
- 边界增强模块(BEM)使整体IoU提升2%至3%,视觉结果表明分割边界与真实物体轮廓对齐更紧密。
- 该方法在四个基准数据集(UNC、UNC+、Google-Ref与ReferItw)上所有标准评估指标下均达到最先进性能。
- 失败案例主要源于查询模糊、罕见词汇(如“cop”)或目标尺寸过小,提示可通过零样本学习或输入缩放进一步改进。
- 消融研究(表5)表明,非对称协同注意力机制对输入尺寸变化更具鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。