Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Domain Adaptation for Chemical Processes on the Tennessee Eastman Process

Eduardo Fernandes Montesuma, Michela Mulas|arXiv (Cornell University)|Aug 22, 2023
Fault Detection and Control SystemsEngineering被引用 3
一句话总结

本论文提出了一种用于化工过程跨域故障诊断(CDFD)的多源无监督域自适应(MSDA)方法,基于田纳西-东部(Tennessee-Eastman, TE)过程基准进行评估。结果表明,在训练过程中利用多个异构源域可显著提升故障分类准确率——相比单源域自适应(SSDA)基线方法平均提升23.48%——其中基于最优传输(OT)的方法(如DaDiL和JDOT)表现最优,因其能有效最小化分布偏移。

ABSTRACT

In system monitoring, automatic fault diagnosis seeks to infer the systems' state based on sensor readings, e.g., through machine learning models. In this context, it is of key importance that, based on historical data, these systems are able to generalize to incoming data. In parallel, many factors may induce changes in the data probability distribution, hindering the possibility of such models to generalize. In this sense, domain adaptation is an important framework for adapting models to different probability distributions. In this paper, we propose a new benchmark, based on the Tennessee Eastman Process of Downs and Vogel (1993), for benchmarking domain adaptation methods in the context of chemical processes. Besides describing the process, and its relevance for domain adaptation, we describe a series of data processing steps for reproducing our benchmark. We then test 11 domain adaptation strategies on this novel benchmark, showing that optimal transport-based techniques outperform other strategies.

研究动机与目标

  • 评估多源域自适应(MSDA)在化工过程跨域故障诊断(CDFD)中的有效性。
  • 比较单源(SSDA)与多源域自适应(MSDA)方法在田纳西-东部(TE)过程不同运行模式间分布偏移处理中的表现。
  • 探究结合多个异构源域数据是否能提升故障诊断性能,相较于单源或仅目标基线方法。
  • 评估各种域自适应技术(尤其是基于最优传输(OT)的方法)在存在分布偏移的真实化工过程数据上的性能表现。
  • 为工业化工系统故障诊断中的迁移学习研究提供一个全面的基准。

提出的方法

  • 本研究采用田纳西-东部(TE)过程作为故障诊断的基准,模拟具有不同数据分布的多种运行模式。
  • 通过在一个源模式的标注数据上进行训练,并使用目标模式的无标注数据,评估单源域自适应(SSDA)方法,通过分布对齐最小化域偏移。
  • 通过在多个源模式的标注数据和目标模式的无标注数据上进行训练,应用多源域自适应(MSDA)方法,利用数据多样性以提升泛化能力。
  • 关键技术包括基于最优传输(OT)的方法,如OTDA、JDOT和DaDiL,这些方法通过最小化源域与目标域分布之间的Wasserstein距离来实现。
  • 框架对比了浅层方法(如MMD、TCA、DANN)与基于深度神经网络的方法,其中特征提取器在自适应过程中可选择微调或固定。
  • 性能通过所有运行模式下的分类准确率进行评估,基线方法包括仅源域(多模式标注数据)和仅目标域(仅无标注目标数据)方法。

实验结果

研究问题

  • RQ1与单源域自适应(SSDA)相比,多源域自适应(MSDA)在化工过程中的故障诊断准确率是否显著提升?
  • RQ2不同域自适应技术(尤其是基于最优传输(OT)的方法)在最小化异构运行模式间分布偏移方面的表现如何?
  • RQ3在未显式进行自适应的情况下,结合多个源域数据在跨域故障诊断(CDFD)中能多大程度上提升泛化能力?
  • RQ4在TE过程的CDFD背景下,浅层域自适应方法是否比基于深度神经网络的方法更有效?
  • RQ5域自适应方法在不同运行模式下的表现如何变化,特别是在模式相近(如模式1和模式5)或差异较大时?

主要发现

  • MSDA相比SSDA基线方法平均提升23.48%的分类准确率,表明来自多个源域的数据多样性可显著增强模型泛化能力。
  • 表现最佳的方法为DaDiL(基于Wasserstein中位数的OT方法),在MSDA设置下实现平均86.14%的准确率,优于最佳SSDA方法(JDOT,准确率为83.13%)。
  • 基于OT的方法(如OTDA和JDOT)始终优于其他方法(如TCA、DANN和MMD),证实了最优传输在分布对齐中的有效性。
  • 浅层域自适应方法优于基于深度学习的方法,表明当分布对齐优化良好时,有效的特征提取可减少对复杂编码器训练的需求。
  • 仅基于OT的方法优于仅源域基线,表明在CDFD中,分布偏移的最小化是性能提升的关键因素。
  • 在模式3中,SSDA优于MSDA,可能是因为存在一个密切相关模式(模式6),表明域之间的相似性会影响自适应的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。