[论文解读] Surgical Gesture Recognition with Optical Flow only
本文提出一种仅使用计算机视觉的手术动作识别方法,仅依赖密集光流,无需运动学传感器或RGB数据。通过使用ImageNet权重进行跨模态预训练初始化基于ResNet的模型,该方法在Suturing任务上实现了具有竞争力的准确率(91.07% ± 0.67),且方差较低,证明光流可作为微创手术中动作识别的稳健替代方案,优于运动学数据。
In this paper, we address the open research problem of surgical gesture recognition using motion cues from video data only. We adapt Optical flow ConvNets initially proposed by Simonyan et al.. While Simonyan uses both RGB frames and dense optical flow, we use only dense optical flow representations as input to emphasize the role of motion in surgical gesture recognition, and present it as a robust alternative to kinematic data. We also overcome one of the limitations of Optical flow ConvNets by initializing our model with cross modality pre-training. A large number of promising studies that address surgical gesture recognition highly rely on kinematic data which requires additional recording devices. To our knowledge, this is the first paper that addresses surgical gesture recognition using dense optical flow information only. We achieve competitive results on JIGSAWS dataset, moreover, our model achieves more robust results with less standard deviation, which suggests optical flow information can be used as an alternative to kinematic data for the recognition of surgical gestures.
研究动机与目标
- 解决仅使用视频中的运动线索进行手术动作识别的开放性问题,消除对额外运动学传感器的依赖。
- 评估仅使用密集光流是否能在手术动作识别中实现与RGB或运动学数据相媲美的性能。
- 通过使用ImageNet权重进行跨模态预训练,克服光学流卷积神经网络在小样本手术数据集上收敛性差的局限性。
- 通过留一超级试验外交叉验证方案,在JIGSAWS基准上展示模型的泛化能力和鲁棒性。
- 提供一种可复现、计算效率高的方法,避免在JIGSAWS等小样本数据集上过拟合。
提出的方法
- 模型仅使用密集光流作为输入,表示为连续视频帧之间的2通道(u,v)向量场。
- 采用BN-ResNet101架构,输入序列为10帧光流,生成20通道输入张量。
- 通过平均预训练的ImageNet RGB卷积滤波器并将其复制到2个光流通道中,实现跨模态预训练,以初始化运动流分支。
- 数据增强包括从256×256缩放后的帧中随机裁剪224×224大小的区域,以及以30Hz或40Hz的帧采样率进行采样,以平衡数据集。
- 训练使用SGD优化器,基础初始学习率为1e-3,采用阶梯式衰减(步长=10,衰减率=0.25),并在80–150个周期左右进行早停。
- 推理阶段使用20帧均匀采样的帧,通过平均帧级预测结果获得视频级预测结果。
实验结果
研究问题
- RQ1仅使用密集光流是否能在不依赖RGB或运动学数据的情况下实现具有竞争力的手术动作识别性能?
- RQ2跨模态预训练在小样本手术数据集上如何改善基于光流模型的收敛性和泛化能力?
- RQ3仅使用运动线索是否能在JIGSAWS基准上实现比其他方法更低方差的更稳健结果?
- RQ4在留一超级试验外验证方案下,基于光流的模型能否在不同手术任务(如Suturing、Needle Passing、Knot Tying)之间有效泛化?
- RQ5所提出的方法是否计算效率高且易于复现,且可借助公开可用工具实现?
主要发现
- 该模型仅使用光流在JIGSAWS数据集的Suturing任务上实现了91.07% ± 0.67的准确率,性能一致性优于许多先前方法。
- 各折之间的标准差较低(Suturing任务为0.67),表明性能稳健且过拟合风险较小。
- 在Needle Passing和Knot Tying任务上,准确率分别达到74.25% ± 3.66和87.78% ± 3.44,表明模型在不同任务间具有强大的泛化能力。
- 模型在80–150个周期内完成收敛,每个小批量仅需约20秒,表明计算效率高。
- 跨模态预训练显著提升了收敛速度,并有效缓解了在小样本JIGSAWS数据集上的过拟合问题。
- 结果表明,光流可作为手术动作识别中运动学数据的可靠且稳健的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。