[论文解读] Referring Camouflaged Object Detection
本文提出了一种新的任务——指代伪装目标检测(Referring Camouflaged Object Detection, Ref-COD),通过显著指代图像作为引导,对特定伪装目标进行分割。该工作引入了包含7000张真实世界图像的R2C7K数据集,以及一个双分支的R2CNet框架,其中包含指代掩码生成(Referring Mask Generation)和指代特征增强(Referring Feature Enrichment)模块,在识别目标伪装目标方面实现了最先进的性能,具有高精度和强鲁棒性。
We consider the problem of referring camouflaged object detection (Ref-COD), a new task that aims to segment specified camouflaged objects based on a small set of referring images with salient target objects. We first assemble a large-scale dataset, called R2C7K, which consists of 7K images covering 64 object categories in real-world scenarios. Then, we develop a simple but strong dual-branch framework, dubbed R2CNet, with a reference branch embedding the common representations of target objects from referring images and a segmentation branch identifying and segmenting camouflaged objects under the guidance of the common representations. In particular, we design a Referring Mask Generation module to generate pixel-level prior mask and a Referring Feature Enrichment module to enhance the capability of identifying specified camouflaged objects. Extensive experiments show the superiority of our Ref-COD methods over their COD counterparts in segmenting specified camouflaged objects and identifying the main body of target objects. Our code and dataset are publicly available at https://github.com/zhangxuying1004/RefCOD.
研究动机与目标
- 为解决标准伪装目标检测(COD)的局限性——即不加区分地检测所有伪装目标——提出一种新任务,仅识别指定的伪装目标。
- 实现在复杂场景中对多个伪装目标存在且与背景视觉相似时,对目标伪装目标进行精确分割。
- 探索利用现成的显著物体图像作为参考,避免昂贵的文本或人工标注,以在真实场景中引导检测。
- 开发一种可扩展且高效的深度学习框架,利用指代图像中的通用表征,提升分割精度与鲁棒性。
提出的方法
- 提出双分支R2CNet框架:参考分支从包含显著物体的指代图像中提取通用表征,分割分支则利用这些表征识别伪装目标。
- 引入指代掩码生成(RMG)模块,通过在参考特征与分割特征之间进行密集的像素级比较,生成像素级的指代先验掩码。
- 采用双源信息融合策略,减少指代图像中显著物体与目标图像中伪装物体之间的外观差异。
- 设计指代特征增强(RFE)模块,通过指代掩码引导实现跨尺度特征交互,增强目标物体的特征判别能力。
- 在分割分支中采用多尺度特征融合,以提升特征表征与定位精度。
- 使用真实标注掩码进行端到端监督训练,通过GT标注对特征进行掩码与池化操作,以学习通用表征。
实验结果
研究问题
- RQ1在复杂杂乱场景中,包含显著物体的指代图像是否能有效引导特定伪装目标的分割?
- RQ2与标准COD相比,利用指代图像中的通用表征在多大程度上提升了伪装目标检测的精度与鲁棒性?
- RQ3像素级指代先验与特征增强机制在多大程度上增强了模型区分目标伪装目标与相似背景物体的能力?
- RQ4在无需昂贵标注的情况下,简单而有效的双分支架构是否能优于现有COD方法,以识别指定的伪装目标?
主要发现
- R2CNet框架在分割指定伪装目标方面显著优于标准COD模型,尤其在存在多个伪装目标且背景相似度高的场景中表现更优。
- 视觉注意力图显示,使用指代图像时,R2CNet能更准确地聚焦于目标伪装目标,减少了与相似非目标物体的干扰。
- 即使仅使用显著物体参考(无文本或详细标注),R2CNet的性能仍优于使用大型预训练模型进行文本参考的方法。
- 消融实验证实,RMG与RFE模块均对性能至关重要:RMG模块提升定位能力,RFE模块增强特征判别能力。
- R2C7K数据集支持全面评估,包含64个类别共7000张真实世界图像,为Ref-COD方法的大规模、多样化基准测试提供支持。
- 模型保持了强大的泛化能力,如在低对比度伪装目标(如猫、小丑鱼)等具有挑战性的案例中表现优异,而基线模型则会失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。