[论文解读] Towards deep learning-powered IVF: A large public benchmark for morphokinetic parameter prediction
本文引入了一个大型公开基准数据集,包含704个胚胎发育的延时视频,涵盖16个详细的形态动力学阶段,共33.7万张标注图像。通过使用ResNet、LSTM和ResNet-3D架构,作者证明了视频感知模型(ResNet-LSTM和ResNet-3D)显著优于仅基于图像的模型,在预测发育阶段转换的时序精度上达到65.9%,从而实现了体外受精(IVF)领域可重复的、社区协作的深度学习研究。
An important limitation to the development of Artificial Intelligence (AI)-based solutions for In Vitro Fertilization (IVF) is the absence of a public reference benchmark to train and evaluate deep learning (DL) models. In this work, we describe a fully annotated dataset of 704 videos of developing embryos, for a total of 337k images. We applied ResNet, LSTM, and ResNet-3D architectures to our dataset and demonstrate that they overperform algorithmic approaches to automatically annotate stage development phases. Altogether, we propose the first public benchmark that will allow the community to evaluate morphokinetic models. This is the first step towards deep learning-powered IVF. Of note, we propose highly detailed annotations with 16 different development phases, including early cell division phases, but also late cell divisions, phases after morulation, and very early phases, which have never been used before. We postulate that this original approach will help improve the overall performance of deep learning approaches on time-lapse videos of embryo development, ultimately benefiting infertile patients with improved clinical success rates (Code and data are available at https://gitlab.univ-nantes.fr/E144069X/bench_mk_pred.git).
研究动机与目标
- 为解决体外受精(IVF)领域中缺乏公开、大规模基准数据集以训练和评估深度学习模型的问题。
- 提供一个完全标注的数据集,包含高分辨率、阶段特异性的形态动力学标签,覆盖16个胚胎发育阶段的延时胚胎视频。
- 建立基线深度学习模型(ResNet、LSTM、ResNet-3D),用于形态动力学参数预测,以支持性能比较和可重复性研究。
- 通过向研究社区公开数据和代码,促进人工智能驱动的IVF研究透明化与公平性。
- 通过基于视频的深度学习捕捉胚胎发育的时序动态,提升IVF临床预测的准确性。
提出的方法
- 作者从临床IVF环境中收集并整理了704个胚胎延时视频,共生成337,000张独立图像。
- 每段视频均经过人工标注,包含16个精确的发育阶段,包括早期卵裂、桑葚胚形成和囊胚阶段,具有高时间分辨率。
- 训练了三种深度学习架构:ResNet(基于图像)、LSTM(基于序列)和ResNet-3D(基于3D视频),用于对每张图像的发育阶段进行分类。
- 采用三种评估指标:标准准确率(p)、生物上合理的准确率(p_v)以及时序精度,后者衡量预测结果相对于真实转换时间的准确性。
- 采用8折交叉验证以确保模型稳健性并减少过拟合,相比以往研究中常用的单次划分验证,该方法提升了泛化能力。
- 数据集已通过GitLab公开发布,附带代码,以支持可重复研究和社区基准测试。
实验结果
研究问题
- RQ1一个大规模、公开可用的延时胚胎视频基准数据集是否能提升IVF领域深度学习模型的可重复性与评估效果?
- RQ2视频感知深度学习模型(如ResNet-3D、ResNet-LSTM)与仅基于图像的模型(如ResNet)在预测形态动力学阶段方面表现如何?
- RQ3深度学习模型在预测关键胚胎发育阶段转换时间方面,能达到多高的时序精度?
- RQ4与以往研究中使用的粗粒度分类方案相比,采用详细的16阶段标注方案是否能显著提升模型性能?
- RQ5该基准数据集是否不仅能支持形态动力学预测,还能支持未来对临床结局的预测模型?考虑到526个视频对应于移植胚胎,该数据集具备此潜力。
主要发现
- ResNet-3D达到最高性能,时序精度为65.9%,意味着在超过65%的案例中,其能将发育阶段转换的时间预测在极窄的时间窗口内。
- ResNet-LSTM的时序精度为55.9%,显著优于仅基于图像的ResNet模型,后者因缺乏时序上下文而准确率较低。
- ResNet-3D的生物上合理的准确率(p_v)达到94.1%,表明其预测结果不仅准确,且与胚胎发育的生物序列一致。
- 该数据集的16阶段标注方案使得对胚胎发育过程的追踪更加精确,包括以往被忽视的阶段,如晚期卵裂和早期桑葚胚。
- 采用8折交叉验证以及基于视频的架构(ResNet-3D、ResNet-LSTM)使模型更具鲁棒性和泛化能力,优于以往研究中采用的单次划分验证方法。
- 该基准数据集已通过 https://gitlab.univ-nantes.fr/E144069X/bench_mk_pred.git 公开提供代码与数据,支持可重复研究及未来模型的开发。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。