Skip to main content
QUICK REVIEW

[论文解读] Scene-centric Joint Parsing of Cross-view Videos

Hang Qi, Yuanlu Xu|arXiv (Cornell University)|Sep 16, 2017
Multimodal Machine Learning Applications被引用 11
一句话总结

本文提出了一种面向多视角视频的场景中心联合解析框架,通过概率推理将视角中心的提议整合为连贯且可解释的场景中心解析图。通过建模多个摄像头之间的外观、几何和常识约束,该方法在视图中心预测的基础上提升了准确性,在动作识别和属性识别任务上实现了最先进性能,mAP(平均平均精度)更高。

ABSTRACT

Cross-view video understanding is an important yet under-explored area in computer vision. In this paper, we introduce a joint parsing framework that integrates view-centric proposals into scene-centric parse graphs that represent a coherent scene-centric understanding of cross-view scenes. Our key observations are that overlapping fields of views embed rich appearance and geometry correlations and that knowledge fragments corresponding to individual vision tasks are governed by consistency constraints available in commonsense knowledge. The proposed joint parsing framework represents such correlations and constraints explicitly and generates semantic scene-centric parse graphs. Quantitative experiments show that scene-centric predictions in the parse graph outperform view-centric predictions.

研究动机与目标

  • 解决由于遮挡和视图受限导致的多摄像头视频分析中理解模糊和碎片化的问题。
  • 开发一个统一框架,联合推理多个摄像头视角下的人员、动作和属性识别。
  • 将视角中心的提议整合为一个强制跨视角一致性和连贯性的场景中心解析图。
  • 实现可解释的、基于约束的推理,以提升模型的可信度和用户理解能力。
  • 通过利用预训练模块和常识知识,而非端到端深度学习,克服监控场景中的数据稀缺问题。

提出的方法

  • 构建一个分层时空解析图,利用定义对象、动作、部件和属性的本体图来表示场景级语义。
  • 使用预训练的属性语法模型生成视角中心解析图作为初始提议,再通过概率推理将其统一为场景中心解析图。
  • 将联合解析表述为最大后验概率(MAP)推理问题,整合跨视角的外观、几何和语义一致性约束。
  • 采用混合推理策略,结合马尔可夫链蒙特卡洛(MCMC)采样与动态规划,高效探索联合解空间。
  • 利用预计算的视角中心提议作为热启动,加速MCMC采样,实现实时性能(在4台摄像机的3分钟场景上达到5帧/秒)。
  • 将场景中心预测结果投影回各视角,使用mAP和各类别平均精度等标准指标进行评估。

实验结果

研究问题

  • RQ1与视角中心方法相比,统一的、场景中心的表示是否能提升多视角视频理解中的识别准确率?
  • RQ2如何有效建模重叠摄像头视角之间的外观和几何约束,以解决歧义问题?
  • RQ3常识知识和语义一致性约束在多视角场景解析中,能在多大程度上增强连贯性和可解释性?
  • RQ4基于预训练模块和基于约束的推理的联合解析框架,是否能在低数据场景下超越端到端深度学习?
  • RQ5所生成解析图的可解释性在多大程度上支持视觉系统中的用户信任和可解释性?

主要发现

  • 在CAMPUS数据集(具有遮挡和光照差等挑战性条件)上,场景中心解析图在9个属性类别中的7个类别上优于视角中心提议。
  • 该方法在基线视角中心模型基础上实现了更高的mAP,尤其在复杂的真实世界监控场景中表现显著提升。
  • 该框架在3分钟、4台摄像机的场景上以5帧/秒的速度运行,证明了其在优化推理下实现实时应用的可行性。
  • 失败案例主要源于遮挡区域中视角中心提议的缺失,证实了场景级推理能够弥补视角特定的局限性。
  • 使用预计算的提议作为热启动显著减少了MCMC采样时间,实现了对联合解空间的高效探索。
  • 场景中心解析图表示通过支持相关性、自解释性、一致性和能力,为可解释人工智能界面提供了关键支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。