[论文解读] High-resolution Iterative Feedback Network for Camouflaged Object Detection
该论文提出HitNet,一种高分辨率迭代反馈网络,通过自适应迭代反馈机制,利用多尺度高分辨率先验信息对低分辨率特征进行精细化处理,在四个伪装目标检测基准上实现最先进性能,Fβ^w得分为0.806,通过跨域数据增强实现4.2%的MAE降低。
Spotting camouflaged objects that are visually assimilated into the background is tricky for both object detection algorithms and humans who are usually confused or cheated by the perfectly intrinsic similarities between the foreground objects and the background surroundings. To tackle this challenge, we aim to extract the high-resolution texture details to avoid the detail degradation that causes blurred vision in edges and boundaries. We introduce a novel HitNet to refine the low-resolution representations by high-resolution features in an iterative feedback manner, essentially a global loop-based connection among the multi-scale resolutions. In addition, an iterative feedback loss is proposed to impose more constraints on each feedback connection. Extensive experiments on four challenging datasets demonstrate that our \ourmodel~breaks the performance bottleneck and achieves significant improvements compared with 29 state-of-the-art methods. To address the data scarcity in camouflaged scenarios, we provide an application example by employing cross-domain learning to extract the features that can reflect the camouflaged object properties and embed the features into salient objects, thereby generating more camouflaged training samples from the diverse salient object datasets The code will be available at https://github.com/HUuxiaobin/HitNet.
研究动机与目标
- 解决深度网络下采样导致的伪装目标检测中细粒度边缘和纹理退化问题。
- 克服现有方法在特征提取过程中丢弃高分辨率信息的局限性。
- 设计一种机制,通过多尺度高分辨率特征对低分辨率特征进行迭代优化。
- 通过保留结构细节并增强边界检测能力,提升在挑战性数据集上的性能。
- 通过跨域学习从显著性目标数据集生成逼真训练样本,缓解伪装目标检测中的数据稀缺问题。
提出的方法
- 采用金字塔视觉Transformer(PVT)作为主干网络进行特征提取,实现渐进式空间下采样与多尺度表征。
- 设计多分辨率迭代优化(RIR)模块,通过全局跨尺度反馈,递归地利用高分辨率特征对低分辨率特征进行优化。
- 引入迭代特征反馈(IFF)机制,对反馈流施加约束,以提升特征聚合效果与稳定性。
- 提出迭代反馈损失,以在每个反馈阶段增强监督信号,提升特征优化精度。
- 设计跨域学习(CDL)策略,通过最小-最大对抗优化将显著性目标转换为伪装目标,同时利用对比度指数筛选低质量转换样本。
- 使用对比度指数 $ I_{sc} = \frac{1}{\text{Num}} \sum_{i} \|P_i - P_m\| $,其中 $ P_m $ 为平均强度,$ P_{\text{std}} $ 排除异常值,以选择高伪装程度样本。
实验结果
研究问题
- RQ1高分辨率与低分辨率特征之间的迭代反馈是否能显著提升对伪装目标中细粒度边缘与纹理的检测能力?
- RQ2将高分辨率先验信息整合到低分辨率特征中,对分割任务中的边界定位与结构一致性有何影响?
- RQ3从显著性目标数据集进行的跨域学习在多大程度上能提升伪装目标检测模型的泛化能力与多样性?
- RQ4迭代反馈机制在性能增益与计算成本之间的权衡如何,尤其是在增加反馈迭代次数时?
- RQ5对比度指数是否能有效识别并过滤掉数据增强过程中生成的低质量合成伪装样本?
主要发现
- HitNet在COD10k-Test数据集上取得0.806的加权F1分数,优于29种最先进方法。
- 采用所提出的CDL策略后,$ S_{\alpha} $ 从基线的0.868提升至0.871,$ E_{\phi} $ 从0.932提升至0.935。
- 与仅使用原始显著性目标数据训练相比,跨域学习(CDL)方法使MAE降低4.2%。
- 仅使用原始显著性目标数据训练会导致 $ S_{\alpha} $ 从0.868降至0.844,$ E_{\phi} $ 从0.932降至0.911,表明缺乏适当增强时存在负迁移现象。
- 迭代反馈机制在最多4次迭代时持续提升性能,之后性能增益趋于饱和,尽管推理时间随之增加。
- 失败案例(如具有复杂拓扑结构的毛毛虫)表明,当前方法在处理密集且细粒度结构时仍存在局限,提示在长距离边缘建模方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。