Skip to main content
QUICK REVIEW

[论文解读] Multi-fidelity Gaussian Process for Biomanufacturing Process Modeling with Small Data

Yuan Sun, Winton Nathan-Roberts|arXiv (Cornell University)|Nov 26, 2022
Viral Infectious Diseases and Gene Expression in Insects被引用 4
一句话总结

本文提出了一种多保真度高斯过程(MFGP)框架,以在数据有限的情况下提升生物制造中的生物工艺建模。通过整合低保真度实验数据(例如小规模生物反应器或不同细胞系的数据)与高保真度数据,MFGP模型利用层次相关性提升预测准确性——在小样本条件下,其性能显著优于单保真度和线性模型。

ABSTRACT

In biomanufacturing, developing an accurate model to simulate the complex dynamics of bioprocesses is an important yet challenging task. This is partially due to the uncertainty associated with bioprocesses, high data acquisition cost, and lack of data availability to learn complex relations in bioprocesses. To deal with these challenges, we propose to use a statistical machine learning approach, multi-fidelity Gaussian process, for process modelling in biomanufacturing. Gaussian process regression is a well-established technique based on probability theory which can naturally consider uncertainty in a dataset via Gaussian noise, and multi-fidelity techniques can make use of multiple sources of information with different levels of fidelity, thus suitable for bioprocess modeling with small data. We apply the multi-fidelity Gaussian process to solve two significant problems in biomanufacturing, bioreactor scale-up and knowledge transfer across cell lines, and demonstrate its efficacy on real-world datasets.

研究动机与目标

  • 解决由于实验成本高和生物变异性导致的生物工艺建模中小样本的问题。
  • 克服传统数据驱动模型对大规模数据集的依赖性以及缺乏可解释性的问题。
  • 通过多保真度学习提升生物反应器放大和跨细胞系知识迁移的预测准确性。
  • 证明MFGP能够有效利用不同保真度水平的异质数据源,以增强模型泛化能力。
  • 在高保真度数据有限的真实生物制造数据集上,评估非线性和线性自回归MFGP变体的性能。

提出的方法

  • 采用多保真度高斯过程(MFGP)回归,利用多保真度水平的数据对生物工艺动态进行建模。
  • 将小规模生物反应器或低表征程度细胞系的数据视为低保真度输入,将高通量、高精度的数据视为高保真度目标。
  • 采用非线性自回归结构(NARGP)以建模低保真度与高保真度数据之间的复杂非线性相关性,优于线性替代方案。
  • 采用线性自回归模型(LARGP)作为基线进行比较,假设保真度水平之间存在线性关系。
  • 通过联合似然函数联合训练模型,利用高斯过程先验考虑两种保真度水平及其不确定性。
  • 通过边缘似然最大化优化超参数,以平衡保真度特异性噪声与跨保真度相关性。

实验结果

研究问题

  • RQ1当高保真度数据稀缺时,MFGP能否有效提升生物工艺建模的预测准确性?
  • RQ2在生物工艺放大任务中,非线性MFGP(NARGP)与线性MFGP(LARGP)及单保真度模型相比表现如何?
  • RQ3利用MFGP,一个细胞系(低保真度)的知识能在多大程度上传递给另一个细胞系(高保真度)?
  • RQ4高保真度训练样本数量如何影响MFGP模型的预测性能?
  • RQ5在何种场景下,MFGP在生物制造应用中优于传统数据驱动模型或机理模型?

主要发现

  • NARGP模型在所有测试模型中RMSE最低,表明其因能够捕捉保真度水平之间的非线性相关性而表现更优。
  • GP-Low模型表现显著差于其他模型,表明仅依赖低保真度数据不足以实现准确预测,因系统动力学存在显著差异。
  • LARGP和GP-Cat模型均被GP-High模型超越,表明在工艺放大任务中,低保真度与高保真度数据之间的相关性为非线性。
  • 所有模型的性能随高保真度训练数据增多而提升,但NARGP模型在小样本条件下提升最为显著,凸显其数据效率。
  • 在生物反应器放大任务中,LARGP模型优于NARGP,表明底层数据相关性过于嘈杂,导致非线性模型难以有效学习。
  • 在跨细胞系知识迁移任务中,NARGP模型优于所有基线,证实细胞系之间的关系为非线性,且更宜由非线性MFGP捕捉。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。