Skip to main content
QUICK REVIEW

[论文解读] Instance Segmentation and Tracking with Cosine Embeddings and Recurrent Hourglass Networks

Christian Payer, Darko Štern|arXiv (Cornell University)|Jun 6, 2018
Advanced Neural Network Applications参考文献 13被引用 6
一句话总结

该论文提出了一种基于余弦嵌入损失的循环全卷积网络,用于视频中的实例分割与跟踪。通过将ConvGRU集成到堆叠的沙漏架构中,并采用一种新型基于余弦相似度的损失函数,仅在相邻实例之间强制实现差异性,该方法在ISBI细胞追踪挑战赛中取得了最先进性能,在跟踪和分割指标上均优于先前方法,尤其在密集细胞布局场景下表现突出。

ABSTRACT

Different to semantic segmentation, instance segmentation assigns unique labels to each individual instance of the same class. In this work, we propose a novel recurrent fully convolutional network architecture for tracking such instance segmentations over time. The network architecture incorporates convolutional gated recurrent units (ConvGRU) into a stacked hourglass network to utilize temporal video information. Furthermore, we train the network with a novel embedding loss based on cosine similarities, such that the network predicts unique embeddings for every instance throughout videos. Afterwards, these embeddings are clustered among subsequent video frames to create the final tracked instance segmentations. We evaluate the recurrent hourglass network by segmenting left ventricles in MR videos of the heart, where it outperforms a network that does not incorporate video information. Furthermore, we show applicability of the cosine embedding loss for segmenting leaf instances on still images of plants. Finally, we evaluate the framework for instance segmentation and tracking on six datasets of the ISBI celltracking challenge, where it shows state-of-the-art performance.

研究动机与目标

  • 为解决在生物医学成像中跨视频帧跟踪单个实例的挑战,特别是在细胞追踪中实例连贯性至关重要的场景。
  • 通过学习在时间上保持一致的判别性嵌入,提升实例分割性能,同时实现在帧间鲁棒的聚类。
  • 通过引入一种新型基于余弦相似度的损失函数,仅关注相邻实例之间的差异性,克服现有基于嵌入方法的局限性,提升优化与稳定性。
  • 通过在全卷积架构中引入ConvGRU,实现时空嵌入的端到端学习,以支持跟踪任务。
  • 展示该方法在多样化数据集上的泛化能力,包括医学MR视频、植物图像以及具有挑战性的细胞追踪基准。

提出的方法

  • 该框架在收缩路径与扩张路径之间插入ConvGRU,构建基于堆叠沙漏网络的结构,以在视频帧之间传播时间信息。
  • 每个像素被赋予一个d维的嵌入向量,网络通过一种新型余弦嵌入损失进行训练,该损失强制同一实例内部具有高相似性,而仅在相邻实例之间强制实现低相似性。
  • 余弦嵌入损失基于四色定理推导,减少了所需差异对的数量,从而在高实例数场景下提升优化稳定性。
  • 通过在每帧中使用k-means或类似方法对预测的嵌入进行聚类,实现实例分割,同时通过嵌入的时间传播维持跟踪。
  • 网络采用联合损失函数进行端到端训练:包括用于分割的二元交叉熵损失,以及用于实例区分的余弦嵌入损失。
  • 该架构在多个数据集上进行了评估,包括MR视频中的左心室分割、植物叶片分割,以及ISBI细胞追踪挑战赛。

实验结果

研究问题

  • RQ1基于学习到的嵌入,循环全卷积网络能否有效实现视频帧间实例分割的跟踪?
  • RQ2与基于标准欧氏距离的损失函数相比,仅考虑相邻实例的基于余弦的嵌入损失是否能提升训练稳定性与性能?
  • RQ3所提出的方法能否在具有挑战性的生物医学视频数据集上实现实例分割与跟踪的最先进性能?
  • RQ4与非循环或结构不同的循环架构相比,将ConvGRU集成到堆叠沙漏网络中对性能有何影响?
  • RQ5当应用于极小或高度密集的实例时,该方法存在哪些局限性?如何加以缓解?

主要发现

  • 在ISBI细胞追踪挑战赛中,该方法在六组数据集中的四组上,于跟踪指标中位列第一或第二,尤其在密集的Fluo-N2DH-S1数据集中表现最佳。
  • 在DIC-HeLa数据集(具有密集细胞布局)上,该方法在跟踪与分割指标上均优于所有其他方法,跟踪F1分数达到0.983,分割F1分数达到0.975。
  • 在Fluo-GOWT1数据集上,该方法总体排名第二,跟踪F1分数为0.981,分割F1分数为0.983。
  • 在植物叶片的静态图像上,该方法表现强劲,其在CVPPP挑战赛中的表现与领先方法相当,测试集的三折交叉验证F1分数达到0.828。
  • 在MR视频的左心室分割任务中,带有ConvGRU的循环沙漏网络优于非循环基线模型,证明了时间建模的优势。
  • 在Fluo-HeLa与Fluo-SIM+数据集中,该方法表现欠佳,原因在于下采样导致细胞尺寸缩小至可检测阈值以下,表明需要采用保留分辨率的处理策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。