Skip to main content
QUICK REVIEW

[论文解读] Semantics Meet Saliency: Exploring Domain Affinity and Models for Dual-Task Prediction

Amirul Islam, Mahmoud Kalash|arXiv (Cornell University)|Jul 25, 2018
Visual Attention and Saliency Detection参考文献 20被引用 5
一句话总结

本文提出一种双任务深度学习框架,联合预测语义分割与显著性图,展示了两项任务之间的相互性能提升。通过探索领域亲和性与信息流配置,该模型通过共享特征学习和语义对象共现分析,在‘人’等频繁显著类别上实现显著改进。

ABSTRACT

Much research has examined models for prediction of semantic labels or instances including dense pixel-wise prediction. The problem of predicting salient objects or regions of an image has also been examined in a similar light. With that said, there is an apparent relationship between these two problem domains in that the composition of a scene and associated semantic categories is certain to play into what is deemed salient. In this paper, we explore the relationship between these two problem domains. This is carried out in constructing deep neural networks that perform both predictions together albeit with different configurations for flow of conceptual information related to each distinct problem. This is accompanied by a detailed analysis of object co-occurrences that shed light on dataset bias and semantic precedence specific to individual categories.

研究动机与目标

  • 研究在单一深度学习框架中结合语义分割与显著性检测的相互益处。
  • 分析语义与显著性之间的领域亲和性,特别是语义知识如何影响显著性预测,反之亦然。
  • 识别在显著性排名中始终占主导地位的物体类别,并研究揭示感知偏见的共现模式。
  • 评估不同网络架构在双任务学习中的表现,并确定最优的信息流配置。

提出的方法

  • 提出四种端到端深度神经网络的变体,通过共享分支与任务特定分支,联合预测语义分割与显著性图。
  • 采用编码器-解码器架构并引入跳跃连接,以保留两项任务的空间细节。
  • 引入多任务损失函数,结合交叉熵用于语义分割与二元交叉熵用于显著性预测。
  • 使用 PASCAL-S 与 PASCAL VOC 数据集进行训练与评估,结合数据增强与迁移学习。
  • 对网络配置进行消融研究,评估共享特征学习与解耦特征学习对性能的影响。
  • 对显著类别进行共现分析,量化偏好排名并检测数据集偏差。

实验结果

研究问题

  • RQ1语义分割是否能提升显著性预测?语义知识在识别显著区域方面有多大益处?
  • RQ2显著性预测能否增强细粒度的语义分割,特别是在边界定义与前景-背景分离方面?
  • RQ3哪种网络架构与信息流配置最能促进语义与显著性任务之间的相互提升?
  • RQ4哪些语义类别在显著性排名中始终位居首位?哪些因素影响其在显著性排名中的主导地位?
  • RQ5是否存在显著的物体对共现模式,揭示感知或数据集偏差?

主要发现

  • 所提出的双任务模型在 PASCAL-S 上将平均 IoU 提升 0.02(从 0.66 提升至 0.67),在频繁显著类别如‘person’上取得显著增益(IoU 从 0.84 提升至 0.86)。
  • ‘person’ 类别最常被列为最显著物体,在共现情况下有 50% 的概率高于 ‘motorbike’ 的显著性排名。
  • 共现分析显示,当与 ‘dog’、‘bus’ 或 ‘horse’ 配对时,‘person’ 的显著性降低,通常由于中心偏置、尺寸过小或位于背景位置。
  • 基于显著性的语义学习提升了常见显著类别上的性能,表明显著性信号可增强语义特征学习。
  • 采用共享编码器与任务特定头的模型优于解耦配置,表明共享表示学习对两项任务均有益处。
  • 失败案例的视觉检查显示,动态动作或非人物体的中心放置常会覆盖‘person’的显著性,即使‘person’存在。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。