[论文解读] Surveillance Video Parsing with Single Frame Supervision
本文提出单帧视频解析(SVP),一种端到端深度学习框架,仅需每段视频标注一帧即可实现准确的监控视频解析。通过利用在线光流估计的时序上下文,以及对短距离和长距离帧的粗略解析结果进行置信度感知融合,SVP在极少监督下实现了最先进性能,在新收集的室内和室外数据集上表现出鲁棒性与实时适用性。
Surveillance video parsing, which segments the video frames into several labels, e.g., face, pants, left-leg, has wide applications. However,pixel-wisely annotating all frames is tedious and inefficient. In this paper, we develop a Single frame Video Parsing (SVP) method which requires only one labeled frame per video in training stage. To parse one particular frame, the video segment preceding the frame is jointly considered. SVP (1) roughly parses the frames within the video segment, (2) estimates the optical flow between frames and (3) fuses the rough parsing results warped by optical flow to produce the refined parsing result. The three components of SVP, namely frame parsing, optical flow estimation and temporal fusion are integrated in an end-to-end manner. Experimental results on two surveillance video datasets show the superiority of SVP over state-of-the-arts.
研究动机与目标
- 解决监控视频解析中的稀疏标注问题,即对所有帧进行像素级标注耗时过长。
- 开发一种实用的视频解析框架,训练时每段视频仅需一帧标注,最大限度降低标注成本。
- 利用视频序列中的丰富时序上下文,缓解因监督信息有限导致的过拟合问题。
- 设计一个端到端、实时的系统,集成帧解析、光流估计与时序融合,实现鲁棒推理。
- 发布一个新的室内与室外监控视频解析数据集,作为未来研究的基准。
提出的方法
- 使用三帧图像——当前帧 $I_t$、短距离前一帧 $I_{t-s}$ 和长距离前一帧 $I_{t-l}$——作为输入,以建模时序上下文。
- 应用帧解析子网络,为三帧中的每一帧生成粗略的语义分割图。
- 通过专用子网络估计帧间密集光流,以建模时间维度上的像素级对应关系。
- 基于形变特征与原始图像之间的外观差异,计算像素级置信度图,以评估光流的可靠性。
- 利用置信度加权的光流,融合三帧的粗略解析结果,生成精细化且时序一致的分割输出。
- 端到端训练整个SVP框架,联合优化特征学习、分类、对应关系挖掘与融合过程。
实验结果
研究问题
- RQ1仅使用每段视频一帧标注,视频解析模型能否实现高精度,显著降低标注成本?
- RQ2在极端标签稀缺条件下,多帧提供的时序上下文能否有效提升解析性能?
- RQ3在线、实时的光流估计能否有效集成到端到端视频解析框架中,且不损失精度?
- RQ4对光流预测结果进行置信度加权,如何提升对光流误差的鲁棒性?
- RQ5所提方法能否在多样化监控环境(如室内与室外场景)中实现良好泛化?
主要发现
- SVP在两个新收集的监控视频解析数据集上达到最先进性能,在单帧监督下优于现有方法。
- 在室外数据集上,采用置信度加权的SVP(SVP l+s+c)F1分数达到0.5294,显著优于基线方法SVP l+s(0.5117)。
- 定性结果表明,SVP能正确识别并定位如鞋带、鞋履等难以检测的部件,而基线方法常将其遗漏或误分类。
- 该框架能有效过滤低置信度光流区域的错误预测,即使光流估计不准确,也能保持准确的分割结果。
- SVP在GPU上运行仅需毫秒级时间,适合实时部署;而离线光流方法如EpicFlow虽F1分数略高,但速度显著更慢。
- 消融实验表明,同时结合短距离与长距离帧可提升性能,二者在准确性和多样性方面提供互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。