[论文解读] Cross-modal Active Complementary Learning with Self-refining Correspondence
本文提出了一种广义框架——跨模态鲁棒互补学习(CRCL),通过一种新颖的主动互补损失(ACL)和基于动量的自修正对应关系校正(SCC),提升了图像-文本匹配在噪声对应关系(NC)下的鲁棒性。ACL结合主动学习(聚焦于可靠的正样本对)与互补学习(利用无关样本作为间接监督),以减少误导性信号;SCC则通过动量增强的迭代自修正过程,稳定并提升对应关系校正效果,在Flickr30K、MS-COCO和CC152K数据集上,无论在合成噪声还是真实世界噪声下,均实现了最先进水平的鲁棒性表现。
Recently, image-text matching has attracted more and more attention from academia and industry, which is fundamental to understanding the latent correspondence across visual and textual modalities. However, most existing methods implicitly assume the training pairs are well-aligned while ignoring the ubiquitous annotation noise, a.k.a noisy correspondence (NC), thereby inevitably leading to a performance drop. Although some methods attempt to address such noise, they still face two challenging problems: excessive memorizing/overfitting and unreliable correction for NC, especially under high noise. To address the two problems, we propose a generalized Cross-modal Robust Complementary Learning framework (CRCL), which benefits from a novel Active Complementary Loss (ACL) and an efficient Self-refining Correspondence Correction (SCC) to improve the robustness of existing methods. Specifically, ACL exploits active and complementary learning losses to reduce the risk of providing erroneous supervision, leading to theoretically and experimentally demonstrated robustness against NC. SCC utilizes multiple self-refining processes with momentum correction to enlarge the receptive field for correcting correspondences, thereby alleviating error accumulation and achieving accurate and stable corrections. We carry out extensive experiments on three image-text benchmarks, i.e., Flickr30K, MS-COCO, and CC152K, to verify the superior robustness of our CRCL against synthetic and real-world noisy correspondences.
研究动机与目标
- 解决图像-文本匹配中噪声对应关系(NC)这一关键挑战,因为真实世界数据中常包含错位的图像-文本对。
- 克服现有方法在高噪声水平下因过度拟合噪声样本对而产生不可靠校正的问题。
- 开发一种广义框架,提升鲁棒性,且无需对现有图像-文本匹配模型进行架构修改。
- 在主动学习与互补学习之间取得平衡,以降低错误监督的风险,同时保持模型性能。
- 通过迭代式、基于动量的自修正过程,提升对应关系校正的准确性和稳定性。
提出的方法
- 提出一种主动互补损失(ACL),整合主动学习(聚焦于可靠正样本对)与互补学习(利用无关样本作为间接监督),以减少误导性信号。
- 在互补学习组件中引入指数归一化,以稳定损失更新,提升对噪声监督的鲁棒性。
- 设计一种自修正对应关系校正(SCC)机制,通过带动量校正的多轮自修正过程,聚合历史预测结果。
- 利用动量校正(MC)在训练周期中稳定并优化对应关系预测,减少误差累积。
- 将ACL与SCC作为即插即用模块集成到现有图像-文本匹配模型中,实现在噪声数据下的鲁棒训练。
- 通过结合软边缘校正与主动样本选择,受控地利用深度神经网络的记忆效应。
实验结果
研究问题
- RQ1如何设计一种损失函数,以在噪声对应关系下降低图像-文本匹配中错误监督的风险?
- RQ2主动学习与互补学习在多大程度上可协同优化,以提升对噪声图像-文本对的鲁棒性?
- RQ3基于动量校正的迭代自修正过程能否提升噪声环境下对应关系校正的准确性和稳定性?
- RQ4与现有方法相比,所提出的CRCL框架在高比例合成噪声与真实世界噪声对应关系下的表现如何?
- RQ5该框架是否可泛化应用于多种现有图像-文本匹配架构,而无需进行架构修改?
主要发现
- 所提出的CRCL框架在Flickr30K、MS-COCO和CC152K数据集上,无论在合成噪声还是真实世界噪声对应关系设置下,均实现了最先进性能。
- ACL通过平衡主动学习与互补学习,显著减少了对噪声样本对的过拟合,带来更稳定的训练动态。
- 结合动量校正的SCC有效减少了误差累积,提升了对应关系校正的准确性,尤其在高噪声水平下表现突出。
- 大量消融实验表明,ACL与SCC在提升鲁棒性方面具有协同效应:ACL提供可靠监督,SCC确保准确校正。
- 该框架展现出强大的泛化能力,仅通过极小的架构改动即可显著增强现有图像-文本匹配模型。
- 在MS-COCO数据集上,当噪声比例达50%时,CRCL显著优于先前方法,证实其在极端噪声条件下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。