Skip to main content
QUICK REVIEW

[论文解读] Motion-Based Weak Supervision for Video Parsing with Application to Colonoscopy

Ori Kelner, Or Weinstein|arXiv (Cornell University)|Oct 16, 2022
Colorectal Cancer Screening and Detection被引用 6
一句话总结

本文提出了一种两阶段、基于运动的弱监督框架,用于结肠镜视频解析,利用光流衍生的运动线索生成噪声标签,以训练帧外观分类器和时间卷积网络。与仅依赖运动的基线相比,该方法在阶段转换检测中的平均绝对误差(1.14 分钟)降低了 47%,实现了无需人工标注的准确阶段分割。

ABSTRACT

We propose a two-stage unsupervised approach for parsing videos into phases. We use motion cues to divide the video into coarse segments. Noisy segment labels are then used to weakly supervise an appearance-based classifier. We show the effectiveness of the method for phase detection in colonoscopy videos.

研究动机与目标

  • 为解决医学视频解析中帧级标注的高成本与高难度,特别是结肠镜视频中的问题。
  • 开发一种弱监督方法,通过利用运动线索作为替代监督,避免依赖人工标注的阶段边界。
  • 通过在运动衍生标签上训练的基于外观的分类器,提升结肠镜视频中阶段检测的准确性。
  • 评估基于 MS-TCN 的时间建模在弱监督特征上进行阶段边界定位的有效性。

提出的方法

  • 基于运动的解析利用光流和通过格林定理的散度积分,估算自身运动方向,识别前向(插入)和后向(退镜)运动。
  • 通过随时间累积运动方向生成噪声阶段标签,全局最大值指示阶段转换点。
  • 基于 ResNet50 的帧分类器在由运动分析标注的随机采样帧上进行微调,学习用于阶段区分的外观特征。
  • 多阶段时间卷积网络(MS-TCN)将帧级预测聚合为时间序列,利用运动衍生标签进行弱监督。
  • 通过在预测概率上最大化划分得分函数,计算最优阶段边界。
  • 该方法结合分类器提取的外观特征与时间建模,以提升泛化能力并降低误差。

实验结果

研究问题

  • RQ1仅靠运动线索是否足以提供足够的监督,用于训练结肠镜视频中基于外观的视频解析模型?
  • RQ2基于运动标签的弱监督与全监督在阶段转换检测中的表现相比如何?
  • RQ3在视觉特征中引入运动信号是否会因标签噪声而降低模型性能?
  • RQ4当在噪声运动衍生标签上训练时,使用 MS-TCN 的时间建模是否能改善阶段边界定位?

主要发现

  • 与仅依赖运动的基线相比,所提方法在阶段转换检测中的平均绝对误差(MAE)降低了 47%(从 2.15 分钟降至 1.14 分钟)。
  • 中位绝对误差(MedAE)降低超过 50%,从 0.99 分钟降至 0.49 分钟,表明鲁棒性显著提升。
  • 在弱监督分类器提取的特征上使用 MS-TCN 的性能优于所有其他配置,包括使用运动方向或组合特征的配置。
  • 将运动方向作为输入添加到 MS-TCN 会降低性能(MAE 1.61 分钟),表明当与视觉特征融合时,噪声运动标签会干扰泛化能力。
  • 该方法在无需任何人工标注帧的情况下实现优异性能,完全依赖基于运动的弱监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。