[论文解读] Unifying Instance and Panoptic Segmentation with Dynamic Rank-1 Convolutions
该论文提出 DR1Mask,一种统一的全卷积实例分割与全景分割框架,利用动态秩-1卷积(DR1Conv)高效融合高层语义上下文与低层细节特征,仅通过增加一个额外分类层即可在实例分割与全景分割任务上实现最先进性能。该方法在使用 ResNet-50 主干网络时,相较于先前的双分支模型实现 2 倍推理速度提升,同时在 COCO 数据集上将全景分割质量(PQ)提升 8 个百分点。
Recently, fully-convolutional one-stage networks have shown superior performance comparing to two-stage frameworks for instance segmentation as typically they can generate higher-quality mask predictions with less computation. In addition, their simple design opens up new opportunities for joint multi-task learning. In this paper, we demonstrate that adding a single classification layer for semantic segmentation, fully-convolutional instance segmentation networks can achieve state-of-the-art panoptic segmentation quality. This is made possible by our novel dynamic rank-1 convolution (DR1Conv), a novel dynamic module that can efficiently merge high-level context information with low-level detailed features which is beneficial for both semantic and instance segmentation. Importantly, the proposed new method, termed DR1Mask, can perform panoptic segmentation by adding a single layer. To our knowledge, DR1Mask is the first panoptic segmentation framework that exploits a shared feature map for both instance and semantic segmentation by considering both efficacy and efficiency. Not only our framework is much more efficient -- twice as fast as previous best two-branch approaches, but also the unified framework opens up opportunities for using the same context module to improve the performance for both tasks. As a byproduct, when performing instance segmentation alone, DR1Mask is 10% faster and 1 point in mAP more accurate than previous state-of-the-art instance segmentation network BlendMask. Code is available at: https://git.io/AdelaiDet
研究动机与目标
- 将实例分割与全景分割统一为一个高效、全卷积的端到端框架,实现跨任务的特征共享。
- 解决现有双分支全景分割模型中效率低下与特征共享不足的问题,尤其在语义分割头设计方面。
- 设计一种参数与计算效率均高的动态特征融合机制,即使在高维特征图上也能保持高效。
- 在保持或提升精度的前提下,实现高分辨率掩码预测,同时将推理成本降至最低。
- 证明统一架构可在全景分割任务中同时超越独立模型的推理速度与精度表现。
提出的方法
- 提出 DR1Conv,一种动态秩-1卷积模块,通过低秩近似计算高层与低层特征之间的二阶特征交互。
- 在中间层应用 DR1Conv 以融合上下文与细节特征,提升实例分割与语义分割的特征表示能力。
- 设计统一的网络头,仅通过一个额外分类层生成语义分割输出,无需独立的 'stuff' 分支。
- 采用张量分解压缩实例预测头,在几乎不增加计算量的同时将 mAP 提升 1%。
- 在实例与语义分割头之间共享特征图,减少冗余并支持联合优化。
- 采用 3x 训练调度与多尺度增强策略,并在相同条件下测量推理时间以确保公平比较。
实验结果
研究问题
- RQ1统一的全卷积架构是否能在计算开销极低的前提下,同时在实例分割与全景分割任务上实现最先进性能?
- RQ2动态秩-1卷积是否能有效融合多任务中的高层上下文与低层细节特征,且不增加参数量或计算量?
- RQ3在实例分割网络中增加一个单一语义头,是否能实现具有竞争力的语义分割性能,同时保持高推理速度?
- RQ4基特征维度的选择如何影响统一语义与实例分割头的性能表现?
- RQ5为何位置敏感注意力机制会降低全景分割性能?在统一框架中如何缓解该问题?
主要发现
- 在 COCO 实例分割测试集(test-dev)上,DR1Mask 使用 ResNet-50 主干网络实现 44.5 mAP,推理时间仅 79ms,较 BlendMask 提升 1 个百分点 mAP,且快 10%。
- 在全景分割任务中,DR1Mask 在 COCO val2017 上实现 42.9 PQ,较 Panoptic-DeepLab 提升 8 PQ 点,且推理速度提升两倍。
- 与先前最佳双分支模型(如 Panoptic-DeepLab)相比,统一框架将推理时间减少 50%,同时 PQ 提升 8 分。
- 将基特征维度从 32 提升至 64 后,语义分割质量提升 2.1 分,凸显通道宽度对类别判别能力的重要性。
- 位置敏感注意力机制使语义分割性能下降 2.6 分,表明其在统一全景学习中并非最优方案。
- 所提出的基于张量分解的头部结构在计算开销可忽略的前提下将 mAP 提升 1%,充分证明了其在实例预测中的效率优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。