Skip to main content
QUICK REVIEW

[论文解读] Stacked dense optical flows and dropout layers to predict sperm motility and morphology

Vajira Thambawita, Pål Halvorsen|arXiv (Cornell University)|Nov 8, 2019
Sperm and Testicular Function参考文献 19被引用 4
一句话总结

本论文提出一种深度学习方法,结合堆叠的密集光流与正则化dropout的多层感知机(MLP),并采用ResNet-34架构,从视频帧中预测精子的运动性和形态。通过将原始帧与多尺度光流输入相结合,并引入带有dropout的MLP以防止过拟合,该方法在运动性预测上达到8.825的SOTA平均绝对误差(MAE),在形态预测上达到5.293的SOTA MAE。

ABSTRACT

In this paper, we analyse two deep learning methods to predict sperm motility and sperm morphology from sperm videos. We use two different inputs: stacked pure frames of videos and dense optical flows of video frames. To solve this regression task of predicting motility and morphology, stacked dense optical flows and extracted original frames from sperm videos were used with the modified state of the art convolution neural networks. For modifications of the selected models, we have introduced an additional multi-layer perceptron to overcome the problem of over-fitting. The method which had an additional multi-layer perceptron with dropout layers, shows the best results when the inputs consist of both dense optical flows and an original frame of videos.

研究动机与目标

  • 开发一种深度学习模型,以高精度从视频序列中预测精子运动性与形态。
  • 探究密集光流表征在捕捉精子视频数据中时间运动模式方面的有效性。
  • 通过引入dropout等架构修改,在小规模医学视频数据集上减少过拟合。
  • 比较原始帧堆叠与光流增强输入特征在基于回归的精子分析中的性能表现。
  • 在VISEM数据集上,为基于端到端深度学习的自动化计算机辅助精子分析建立基线。

提出的方法

  • 通过提取九帧连续的灰度帧(D1),并将其与RGB帧及两种类型的密集光流图像(步长1与步长10)结合,形成九通道输入张量(D2)。
  • 采用预训练的ResNet-34作为主干网络,微调以适应九通道输入,并调整为输出三个回归值以预测运动性或形态。
  • 提出一种改进模型(M2),在ResNet-34特征后增加一个多层感知机(MLP),并引入dropout层以减轻过拟合。
  • 使用Adam优化器进行模型训练,固定学习率为0.001,并在反向传播中采用均方误差(MSE)作为损失函数。
  • 在VISEM数据集上采用三折交叉验证评估模型,以平均绝对误差(MAE)作为主要性能比较指标。
  • 利用OpenCV的Farnebäck算法在不同时间步长下对连续帧生成密集光流,以捕捉多尺度的运动动态。

实验结果

研究问题

  • RQ1与原始帧堆叠相比,密集光流表征在预测精子运动性与形态方面有何改进?
  • RQ2在小规模医学视频数据集中,引入带有dropout的多层感知机对模型泛化能力与过拟合的影响如何?
  • RQ3在精子质量回归任务中,哪种输入配置——仅原始帧或原始帧与多尺度光流结合——表现更优?
  • RQ4在本医学视频回归任务中,经过架构正则化的改进ResNet-34是否优于标准ResNet-34?
  • RQ5在最小化精子运动性与形态预测的平均绝对误差方面,最优的输入特征与模型架构组合是什么?

主要发现

  • 采用原始帧与密集光流结合(D2输入)及改进的ResNet-34模型(M2)的方法,在精子运动性预测上达到最低的平均绝对误差(MAE)8.825,在形态预测上达到5.293。
  • 带有dropout正则化MLP的M2模型在所有输入类型与折数中均持续优于基础M1模型,证明了架构正则化的有效性。
  • D2输入(原始帧与光流特征结合)的表现优于D1(仅堆叠原始帧),表明运动信息可提升预测性能。
  • 最佳配置(D2-M2)相比基础模型(D1输入)在运动性MAE上提升10.5%,在形态MAE上提升5.3%。
  • 采用D2输入与M2架构的模型在所有折数中均达到最低平均MAE,各折数值分别为:运动性8.612(第1折)、7.873(第2折)与9.991(第3折)。
  • 多尺度光流(步长1与步长10)提供了互补的运动线索,有助于改善时间建模并提升泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。