[论文解读] Promising or Elusive? Unsupervised Object Segmentation from Real-world Single Images
本文研究了为何现有无监督目标分割模型在真实图像上表现不佳,尽管其在合成数据集上表现强劲。通过引入四个衡量外观与几何偏差的定量复杂度因子,作者证明了模型归纳偏差与真实世界目标分布之间的不匹配是核心失败原因,呼吁未来工作在模型设计中显式引入目标性先验。
In this paper, we study the problem of unsupervised object segmentation from single images. We do not introduce a new algorithm, but systematically investigate the effectiveness of existing unsupervised models on challenging real-world images. We firstly introduce four complexity factors to quantitatively measure the distributions of object- and scene-level biases in appearance and geometry for datasets with human annotations. With the aid of these factors, we empirically find that, not surprisingly, existing unsupervised models catastrophically fail to segment generic objects in real-world images, although they can easily achieve excellent performance on numerous simple synthetic datasets, due to the vast gap in objectness biases between synthetic and real images. By conducting extensive experiments on multiple groups of ablated real-world datasets, we ultimately find that the key factors underlying the colossal failure of existing unsupervised models on real-world images are the challenging distributions of object- and scene-level biases in appearance and geometry. Because of this, the inductive biases introduced in existing unsupervised models can hardly capture the diverse object distributions. Our research results suggest that future work should exploit more explicit objectness biases in the network design.
研究动机与目标
- 探究无监督目标分割模型在真实世界单幅图像上的真实潜力,挑战‘在合成数据上表现强劲即意味着适用于真实世界’这一假设。
- 识别最先进无监督模型在应用于复杂真实世界场景(如 COCO)时失败的根本原因。
- 通过外观与几何偏差量化对象与场景分割的难度,超越定性的格式塔原则。
- 在受控偏差变化的消融真实世界数据集上,评估四种领先无监督模型(AIR、MONet、IODINE、SlotAtt)的鲁棒性。
- 通过识别当前模型的归纳偏差与真实世界目标分布之间存在根本性不匹配,为未来研究提供指导。
提出的方法
- 提出四个定量复杂度因子——目标颜色梯度、对象间颜色相似度、目标形状规则性与尺度一致性,用于在对象与场景层面测量外观与几何偏差。
- 系统性地构建六个真实世界数据集(YCB、ScanNet、COCO),对这四个因子进行消融,以隔离其对分割性能的影响。
- 在消融数据集上,使用四种代表性无监督方法(AIR、MONet、IODINE、SlotAtt)从头训练超过130个模型,以评估其对偏差分布的敏感性。
- 使用标准指标(AP、PQ、Precision、Recall)对所有消融设置与模型变体的分割性能进行定量评估。
- 通过多个数据集的定性结果分析,可视化不同偏差条件下模型的失败模式与成功模式。
- 对比合成数据集(如 dSprites、CLEVR)与真实世界数据集的性能表现,突出因偏差分布偏移导致的泛化差距。
实验结果
研究问题
- RQ1在合成基准上表现强劲的现有无监督目标分割模型,在真实世界单幅图像上的泛化能力究竟如何?
- RQ2真实世界图像中哪些具体的外观与几何因素最显著地降低无监督分割性能?
- RQ3对对象级与场景级偏差(如颜色梯度、形状规则性)进行消融后,如何影响无监督模型的分割准确率?
- RQ4为何当前无监督模型尽管学习了强大的归纳偏差,仍无法在真实世界图像中发现通用目标?
- RQ5现有模型中的归纳偏差与真实世界图像中实际存在的目标分布之间,不匹配程度究竟有多大?
主要发现
- 现有无监督目标分割模型在真实世界图像上表现灾难性失败,在 COCO-S+T+U 上仅达到 29.4% 的 AP,远低于在合成数据集上超过 80% 的表现。
- 失败的主要原因是当前模型的归纳偏差与真实世界图像中复杂多样的外观与几何偏差分布之间存在不匹配。
- 模型对外观因素表现出高度敏感性:当保留目标颜色梯度与对象间颜色相似度时,性能显著下降,尤其在 COCO 与 ScanNet 上。
- 当外观因素被消融后(如在 C+T 数据集上),分割准确率显著提升,表明外观复杂性是主导失败因素。
- 即使在外观因素被消融后,模型在真实世界数据上仍表现困难,凸显了不规则形状与非均匀尺度等几何偏差的持续挑战。
- MONet 在 COCO-C+T+U 上达到 86.9% 的 AP,但在 COCO-S+T+U 上仅 29.4%,表明即使具备强大归纳偏差,外观变化的存在仍严重损害性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。