[论文解读] End-to-End Instance Segmentation with Recurrent Attention
本文提出一种基于视觉注意力的端到端循环神经网络用于实例分割,通过按顺序逐个检测和分割对象来模拟人类的计数过程。该方法通过联合训练实例计数与分割,在CVPPP、KITTI和Cityscapes数据集上实现了具有竞争力的性能,利用动态非极大值抑制和注意力驱动的优化来处理遮挡问题并减少参数量。
While convolutional neural networks have gained impressive success recently in solving structured prediction problems such as semantic segmentation, it remains a challenge to differentiate individual object instances in the scene. Instance segmentation is very important in a variety of applications, such as autonomous driving, image captioning, and visual question answering. Techniques that combine large graphical models with low-level vision have been proposed to address this problem; however, we propose an end-to-end recurrent neural network (RNN) architecture with an attention mechanism to model a human-like counting process, and produce detailed instance segmentations. The network is jointly trained to sequentially produce regions of interest as well as a dominant object segmentation within each region. The proposed model achieves competitive results on the CVPPP, KITTI, and Cityscapes datasets.
研究动机与目标
- 为解决在杂乱、遮挡场景中区分个体对象实例的挑战,因为语义分割缺乏实例级别的区分能力。
- 开发一种可微分、端到端可训练的架构,联合执行实例计数与像素级分割,无需后处理。
- 通过自顶向下的、迭代的注意力机制建模遮挡鲁棒性,动态抑制重叠检测。
- 通过使用循环的、顺序输出机制替代全局逐像素预测,降低模型复杂度和参数量。
- 通过联合学习分割与置信度评分实现自动停止条件,消除对固定NMS阈值的依赖。
提出的方法
- 模型使用基于LSTM的控制器,通过图像特征上的软注意力机制,迭代地关注感兴趣区域。
- 在每个时间步,框提议网络利用当前视觉片段和隐藏状态,定位下一个感兴趣对象。
- 分割网络使用反卷积层在提议的边界框内生成密集的像素级掩码。
- 评分网络评估检测到的实例的置信度,并决定是否继续或终止序列。
- 外部记忆存储先前分割的实例,以引导注意力并实现在时间步之间的动态非极大值抑制。
- 训练期间应用调度采样,逐步从真实标签监督过渡到模型生成的输入,以提高泛化能力。
实验结果
研究问题
- RQ1基于循环和注意力机制的架构能否在无需后处理的情况下,以可微分、端到端的方式有效执行实例分割?
- RQ2与全局、一次性预测方法相比,注意力驱动的、顺序计数机制在处理遮挡或密集排列对象时表现如何?
- RQ3实例计数与分割的联合学习在多大程度上能提升性能并实现自动停止条件?
- RQ4与标准NMS或自底向上的方法相比,使用外部记忆和动态NMS在提升对遮挡的鲁棒性方面有何增强作用?
- RQ5架构组件(如框网络、注意力机制和调度采样)对分割精度和泛化能力的影响如何?
主要发现
- 该模型在CVPPP、KITTI和Cityscapes基准上实现了具有竞争力的实例分割性能,优于先前的RNN方法,并与若干复杂图模型相当或更优。
- 在KITTI数据集上,该模型成功分割了各种姿态和遮挡条件下的车辆,包括仅可见部分车体的情况。
- 该方法无需后处理即可生成高分辨率、细粒度的实例掩码,而[26, 41]等方法则依赖额外的优化步骤。
- 消融实验表明,初始前景分割和框提议网络对性能至关重要,若移除则覆盖度显著下降。
- 调度采样提升了训练稳定性和泛化能力,增加LSTM中的视觉片段数量(Iter-n)可带来可测量的性能提升。
- 模型通过注意力机制学习优先关注显著对象,随着训练进行,注意力从空间顺序(如从左到右)转向基于置信度的跳跃式关注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。