Skip to main content
QUICK REVIEW

[论文解读] Information Pursuit: A Bayesian Framework for Sequential Scene Parsing

Ehsan Jahangiri, Erdem Yörük|arXiv (Cornell University)|Jan 9, 2017
Anomaly Detection Techniques and Applications参考文献 3被引用 7
一句话总结

本文提出信息探索(Information Pursuit),一种基于贝叶斯框架的顺序场景解析方法,将上下文中的物体关系整合到基于深度学习的识别中。通过迭代选择能最大化与完整场景解释之间互信息的问题,该方法利用对空间排列和三维几何的已学习先验,改进了合成训练数据下餐厅餐桌场景解析的准确性。

ABSTRACT

Despite enormous progress in object detection and classification, the problem of incorporating expected contextual relationships among object instances into modern recognition systems remains a key challenge. In this work we propose Information Pursuit, a Bayesian framework for scene parsing that combines prior models for the geometry of the scene and the spatial arrangement of objects instances with a data model for the output of high-level image classifiers trained to answer specific questions about the scene. In the proposed framework, the scene interpretation is progressively refined as evidence accumulates from the answers to a sequence of questions. At each step, we choose the question to maximize the mutual information between the new answer and the full interpretation given the current evidence obtained from previous inquiries. We also propose a method for learning the parameters of the model from synthesized, annotated scenes obtained by top-down sampling from an easy-to-learn generative scene model. Finally, we introduce a database of annotated indoor scenes of dining room tables, which we use to evaluate the proposed approach.

研究动机与目标

  • 为解决当前深度学习模型往往无法捕捉物体实例之间上下文关系的挑战。
  • 开发一种顺序的、查询驱动的方法,通过高层次分类器输出逐步优化场景解释。
  • 从合成的、带注释的场景中学习物体排列的结构化先验模型,以提升泛化能力。
  • 通过选择能最大化每一步信息增益的有信息量问题,实现从粗到细的场景理解。
  • 通过将语义变量直接嵌入贝叶斯推理框架,弥合端到端深度学习与基于模型的推理之间的差距。

提出的方法

  • 该框架采用贝叶斯模型,其中潜变量(annobits)表示语义物体的存在与位姿,并与训练好的高层次分类器(如卷积神经网络)一一对应。
  • 先验模型通过单应性矩阵和马尔可夫随机场(MRF)编码三维场景几何与二维空间关系,而第二个更模块化的属性图模型则支持高效的数据合成。
  • 数据模型捕捉在给定annobits条件下分类器输出的条件分布,对深度网络产生的噪声响应进行建模。
  • 该框架通过最大化预期答案与完整场景解释之间的互信息来选择下一个问题(查询),确保获得最优信息增益。
  • 参数通过使用属性图模型生成的合成带注释场景进行学习,该模型作为弱监督预训练信号。
  • 姿态分布使用冯·米塞斯分布和贝塔分布对角度和径向相对位置进行建模,且基于物体类别和桌子几何结构施加约束。

实验结果

研究问题

  • RQ1在顺序的、查询驱动的场景解析框架中,如何有效建模物体实例之间的上下文关系?
  • RQ2在场景解释过程中,如何选择能最大化信息增益的问题?
  • RQ3结合深度学习与结构化先验的混合贝叶斯框架,是否能将场景解析准确性提升至独立物体检测之上?
  • RQ4如何从合成的、带注释的数据中高效学习物体排列的先验模型?
  • RQ5在多大程度上,引入空间与几何先验能减少物体检测中的歧义,并提升场景解释的一致性?

主要发现

  • 所提出的Information Pursuit框架通过利用物体之间的上下文关系,显著提升了场景解析的准确性,减少了误报和不一致的检测结果。
  • 基于互信息的问题选择策略显著提升了每次查询的信息增益,从而加快了向准确解释的收敛速度。
  • 来自属性图模型的合成训练数据,使得即使在真实标注数据有限的情况下,也能有效学习更复杂的单应性先验模型的参数。
  • 使用annobits——与分类器直接对应的语义潜变量——使得深度学习输出能够干净地集成到结构化的贝叶斯框架中。
  • 该框架在餐厅餐桌场景中表现出稳健性能,能够正确建模复杂的排列,如包含多个餐具和玻璃杯的餐盘配置,并保持一致的空间布局。
  • 该模型仅通过少量精心选择的查询,即可推理物体位姿与空间关系,展现出在高效、交互式场景理解方面的强大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。