Skip to main content
QUICK REVIEW

[论文解读] Multimodal Deep Neural Networks using Both Engineered and Learned Representations for Biodegradability Prediction

Garrett B. Goh, Khushmeen Sakloth|arXiv (Cornell University)|Aug 13, 2018
Machine Learning and Data Classification参考文献 17被引用 14
一句话总结

本文提出 DeepBioD,一种新颖的多模态 CNN-MLP 神经网络,通过结合工程化分子描述符(Ballabio-40 和 PaDEL-1400)与来自二维化学图像的模型学习表征,用于预测生物降解性。通过整合领域特定的特征工程与深度表征学习,该模型相较于当前最先进水平,实现了 27% 的误差率降低(误差率为 0.125),表明在数据稀缺的化学应用中,混合架构优于独立模型。

ABSTRACT

Deep learning algorithms excel at extracting patterns from raw data, and with large datasets, they have been very successful in computer vision and natural language applications. However, in other domains, large datasets on which to learn representations from may not exist. In this work, we develop a novel multimodal CNN-MLP neural network architecture that utilizes both domain-specific feature engineering as well as learned representations from raw data. We illustrate the effectiveness of such network designs in the chemical sciences, for predicting biodegradability. DeepBioD, a multimodal CNN-MLP network is more accurate than either standalone network designs, and achieves an error classification rate of 0.125 that is 27% lower than the current state-of-the-art. Thus, our work indicates that combining traditional feature engineering with representation learning can be effective, particularly in situations where labeled data is limited.

研究动机与目标

  • 为解决化学性质预测中标签数据有限的挑战,特别是针对生物降解性预测问题。
  • 开发一种多模态深度学习架构,整合工程化分子描述符与原始化学图像的表征学习结果。
  • 在小样本标签、大数据量的化学数据集背景下,提升预测准确率,超越独立的深度学习或传统机器学习模型。
  • 评估网络架构、超参数与特征选择对模型性能与泛化能力的影响。
  • 展示集成学习与可靠性过滤在提升模型鲁棒性与覆盖范围方面的有效性。

提出的方法

  • 该模型使用 CNN(Chemception)从通过 0.5 Å/像素网格和 EngD 颜色编码方案生成的 80×80 像素化学图像中提取分层特征。
  • 工程化分子描述符——Ballabio-40(41 个描述符)和 PaDEL-1400(约 1400 个描述符)——由独立的 MLP 流程进行处理。
  • 将 CNN 的倒数第二层输出与 MLP 的最终层输出拼接,并输入到最终的全连接层中进行分类。
  • 通过使用不同随机种子训练五个独立的 DeepBioD 模型并平均其预测结果,构建集成模型,以提升鲁棒性。
  • 修改后的 DeepBioD+ 模型应用可靠性阈值(类别概率 < 0.8)过滤不确定预测,以提升准确率,代价是覆盖范围降低。
  • 采用弱监督与迁移学习,在更大的无标签数据集上预训练 CNN,以提升在低数据场景下的泛化能力。

实验结果

研究问题

  • RQ1将工程化分子描述符与深度学习图像表征相结合,是否能提升在数据稀缺化学数据集中的生物降解性预测准确率?
  • RQ2与单模态方法相比,多模态输入(图像与描述符)的整合如何影响模型的泛化能力与鲁棒性?
  • RQ3集成学习与可靠性过滤对生物降解性预测中模型性能与预测覆盖范围有何影响?
  • RQ4在多模态深度学习用于化学的背景下,架构选择、超参数与特征选择如何影响最终模型的准确率与泛化能力?
  • RQ5在标签数据有限的情况下,对 CNN 组件进行弱监督预训练是否能提升性能?

主要发现

  • DeepBioD 实现了 0.125 的分类误差率,相较于当前最先进水平的共识模型(误差率 0.170)降低了 27%。
  • 使用单一网络的多模态模型 MM-S-ChemNet 已经优于所有单独的传统机器学习模型以及共识 #1 模型,误差率为 0.133。
  • 修改后的 DeepBioD+ 模型通过过滤类别概率 < 0.8 的预测,实现了 0.090 的误差率与 89% 的预测覆盖范围,相较于共识 #2 模型(误差率 0.130,覆盖范围 87%)提升了 31%。
  • 集成方法显著提升了模型稳定性与泛化能力,降低了多次训练运行之间的方差。
  • 利用更大规模无标签数据集进行弱监督预训练,可增强 CNN 的特征学习能力,并提升下游生物降解性预测任务的性能。
  • 将专家设计的分子描述符与深度学习表征相结合,相比仅依赖工程化特征或原始数据表征的模型,性能更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。