Skip to main content
QUICK REVIEW

[论文解读] Unsupervised part representation by Flow Capsules

Sara Sabour, Andrea Tagliasacchi|arXiv (Cornell University)|Nov 27, 2020
Image Processing and 3D Reconstruction参考文献 40被引用 18
一句话总结

该论文提出FlowCapsules,一种无监督方法,利用运动作为自监督信号,学习物体部件的主胶囊表征。通过利用视频帧间的光流并建模深度顺序,FlowCapsules能够发现解耦的形状掩码,推断被遮挡区域,并在杂乱、有纹理的场景中,于无监督部件分割和图像分类任务上超越先前方法。

ABSTRACT

Capsule networks aim to parse images into a hierarchy of objects, parts and relations. While promising, they remain limited by an inability to learn effective low level part descriptions. To address this issue we propose a way to learn primary capsule encoders that detect atomic parts from a single image. During training we exploit motion as a powerful perceptual cue for part definition, with an expressive decoder for part generation within a layered image model with occlusion. Experiments demonstrate robust part discovery in the presence of multiple objects, cluttered backgrounds, and occlusion. The part decoder infers the underlying shape masks, effectively filling in occluded regions of the detected shapes. We evaluate FlowCapsules on unsupervised part segmentation and unsupervised image classification.

研究动机与目标

  • 解决胶囊网络在无监督情况下学习有效低级部件描述符的局限性。
  • 利用运动作为感知线索,在单幅图像中实现无监督的原子视觉部件发现。
  • 在存在遮挡、杂乱和纹理变化的情况下,提升部件分割与形状补全性能。
  • 在基于胶囊的生成模型中,解耦形状、姿态与深度顺序。
  • 在真实世界和合成数据集上,超越现有无监督部件发现方法。

提出的方法

  • 训练一个孪生网络以估计连续视频帧之间的光流,使用胶囊姿态作为监督信号。
  • 胶囊编码器将单幅图像映射为一组主胶囊,每个胶囊包含规范形状掩码、三维姿态(平移、旋转)和深度标量。
  • 可微分解码器从胶囊参数生成图像帧,通过按深度排序的分层方式建模遮挡。
  • 模型使用光流重建损失,强制预测的胶囊运动与观测到的光流保持一致。
  • 在解码器中显式建模深度顺序,以处理遮挡并提升形状补全性能。
  • 该框架仅使用视频帧端到端自监督训练,无需真实掩码或标签。

实验结果

研究问题

  • RQ1视频帧之间的运动能否作为无监督设置下发现有意义视觉部件的有效自监督信号?
  • RQ2带有深度顺序的胶囊表征能否提升形状补全性能并增强对遮挡的鲁棒性?
  • RQ3在杂乱和纹理变化条件下,FlowCapsules与基于图像重建的方法在部件分割和分类方面相比如何?
  • RQ4在无监督条件下,该模型在多大程度上实现了形状、姿态与深度的解耦?
  • RQ5该方法是否能在多样化的物体类别和复杂场景中泛化?

主要发现

  • FlowCapsules在Geo数据集上达到94%的IoU,在Geo+数据集上达到88%(使用16个胶囊),在无监督部件分割中优于PSD和SCAE。
  • 即使编码长度减少(例如|s_k|=3时IoU为91%),模型仍保持强劲性能,表明其对紧凑形状表征的鲁棒性。
  • 若省略深度顺序,性能显著下降(降至54% IoU),证明其在遮挡处理中的关键作用。
  • 更深的解码器(6层)能提升掩码平滑度与IoU,尤其对圆形形状效果更显著,显示出架构优势。
  • FlowCapsules在CIFAR-100上实现85.3%的无监督图像分类准确率(使用k-means聚类),优于SCAE。
  • 模型能够成功推断出补全部分遮挡区域的形状掩码,即使在任何单帧中部件均未完全可见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。