[论文解读] Adaptive Masked Proxies for Few-Shot Segmentation
该论文提出自适应掩码代理(AMP),一种样本高效的少样本语义分割方法,通过多分辨率掩码平均池化聚合主干网络特征并融合学习到的类别特征,构建最终层权重。AMP在PASCAL-5i数据集上5-shot设置下相比最先进方法提升5.5% mIoU,且无需微调或辅助分支即可实现持续学习,支持双流运动-外观网络,并在视频分割中实现自适应能力。
Deep learning has thrived by training on large-scale datasets. However, in robotics applications sample efficiency is critical. We propose a novel adaptive masked proxies method that constructs the final segmentation layer weights from few labelled samples. It utilizes multi-resolution average pooling on base embeddings masked with the label to act as a positive proxy for the new class, while fusing it with the previously learned class signatures. Our method is evaluated on PASCAL-$5^i$ dataset and outperforms the state-of-the-art in the few-shot semantic segmentation. Unlike previous methods, our approach does not require a second branch to estimate parameters or prototypes, which enables it to be used with 2-stream motion and appearance based segmentation networks. We further propose a novel setup for evaluating continual learning of object segmentation which we name incremental PASCAL (iPASCAL) where our method outperforms the baseline method. Our code is publicly available at https://github.com/MSiam/AdaptiveMaskedProxies.
研究动机与目标
- 为解决机器人和现实应用中大规模数据集不可行时深度学习的样本效率低下问题。
- 消除少样本分割中对第二条引导分支的需求,降低计算开销和模型复杂度。
- 通过无需反向传播即可适应先前学习的类别特征以更新新代理的方式,实现在语义分割中的持续学习。
- 在视频实例分割中支持双流运动与外观网络,而无需额外的参数估计分支。
- 提出一个新基准 iPASCAL,用于在真实流式数据条件下评估持续语义分割。
提出的方法
- AMP通过在预训练主干网络的特征图上应用归一化掩码平均池化(NMAP),利用真实分割标签对响应进行掩码,计算类别代理。
- 通过多分辨率印记机制,聚合来自多个特征图尺度的代理,以提升分割精度。
- 通过可学习的自适应加权机制,将新类别代理与先前学习的类别特征进行融合,实现在不使用反向传播的情况下更新已知类别的权重。
- 自适应机制采用受相关滤波启发的运行平均更新规则,实现从新支持集输入中在线学习。
- AMP通过使用模型自身预测生成的伪标签,以无监督方式更新代理,实现视频分割中的自适应能力。
- 该框架支持权重印记与反向传播的交错进行,以实现进一步适应,同时保持与预训练网络的灵活性。
实验结果
研究问题
- RQ1一种少样本分割方法是否能在不依赖第二条引导分支进行原型估计的情况下实现最先进性能?
- RQ2多分辨率代理印记在低样本条件下对提升分割精度的有效性如何?
- RQ3基于代理的方法能否扩展至持续学习场景,实现新类别顺序引入而无灾难性遗忘?
- RQ4当应用于无额外分支的双流运动-外观网络时,AMP在视频实例分割中的表现如何?
- RQ5像 iPASCAL 这样的新基准是否能有效评估在真实流式数据条件下持续语义分割的性能?
主要发现
- 在 PASCAL-5i 数据集的 5-shot 设置下,AMP 相比最先进方法实现了 5.5% 的 mIoU 提升。
- 在 1-shot 场景中,若不进行代理适应(α = 0),mIoU 下降 28.3%,证明了对已知类别权重自适应的关键作用。
- 多分辨率印记显著提升性能,若省略该机制,1-shot 场景下 mIoU 明显下降。
- 在 DAVIS-2016 基准上,AMP 搭配 CRF 后处理的性能优于最先进无监督视频实例分割方法。
- 在 iPASCAL 持续学习设置中,AMP 超过朴素微调方法,后者在高类别数分类任务中尤其易出现过拟合。
- AMP 利用伪标签实现视频分割中的自适应,性能与 MotAdapt 在 FBMS 上相当,且避免了人工标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。