[论文解读] SubTSBR to tackle high noise and outliers for data-driven discovery of differential equations
该论文提出SubTSBR,一种基于子采样的阈值稀疏贝叶斯回归方法,可提升在数据驱动发现微分方程过程中对高斯噪声和异常值的鲁棒性。通过迭代采样数据子集并应用稀疏贝叶斯推断,SubTSBR在高斯噪声条件下相比TSBR实现了更高的准确性,尤其在存在随机初始/边界条件或分岔动力学的模型发现中表现更优。
Data-driven discovery of differential equations has been an emerging research topic. We propose a novel algorithm subsampling-based threshold sparse Bayesian regression (SubTSBR) to tackle high noise and outliers. The subsampling technique is used for improving the accuracy of the Bayesian learning algorithm. It has two parameters: subsampling size and the number of subsamples. When the subsampling size increases with fixed total sample size, the accuracy of our algorithm goes up and then down. When the number of subsamples increases, the accuracy of our algorithm keeps going up. We demonstrate how to use our algorithm step by step and compare our algorithm with threshold sparse Bayesian regression (TSBR) for the discovery of differential equations. We show that our algorithm produces better results. We also discuss the merits of discovering differential equations from data and demonstrate how to discover models with random initial and boundary condition as well as models with bifurcations. The numerical examples are: (1) predator-prey model with noise, (2) shallow water equations with outliers, (3) heat diffusion with random initial and boundary condition, and (4) fish-harvesting problem with bifurcations.
研究动机与目标
- 解决从含噪声和异常值污染的数据中准确发现控制微分方程的挑战。
- 提升传统方法在高斯噪声环境下失效时的稀疏贝叶斯回归鲁棒性。
- 实现对在随机初始条件或边界条件、或分岔动力学下仍保持有效的微分方程的发现。
- 优化子采样参数(子样大小与子样数量)以最大化准确性和异常值抗性。
- 在含噪声与异常值的真实物理模型中,证明SubTSBR相较于阈值稀疏贝叶斯回归(TSBR)的优越性。
提出的方法
- 对完整数据集进行子采样,生成多个更小但具代表性的数据子集,以降低噪声影响。
- 对每个子样使用稀疏贝叶斯回归,估计微分方程线性模型中基函数权重向量。
- 利用模型选择准则,将多个子样的结果进行融合,以提升估计的稳定性和准确性。
- 通过调整的模型选择准则,优化子采样大小与子样数量,以平衡偏差与方差。
- 引入阈值化处理以在权重向量中强制实现稀疏性,仅选择与微分方程相关的基函数。
- 使用包含时间与状态变量多项式(至指定次数)的基函数库,表示常微分方程/偏微分方程中的候选项。
实验结果
研究问题
- RQ1子采样如何提升稀疏贝叶斯回归在高斯噪声与异常值存在下的准确性和鲁棒性?
- RQ2在最大化发现准确性方面,子采样大小与子样数量之间的最优权衡是什么?
- RQ3当初始条件与边界条件随机采样,或存在分岔现象时,SubTSBR能否可靠地发现微分方程?
- RQ4在含噪声数据条件下,SubTSBR与TSBR在准确性和稳定性方面的定量比较如何?
- RQ5在给定置信水平下,可靠排除异常值所需的最少子样数量是多少?
主要发现
- 在2%高斯噪声的捕食者-猎物模型中,SubTSBR在发现微分方程方面优于TSBR,验证了其优越性。
- SubTSBR的准确性随子采样大小先上升后下降,表明存在一个在偏差与方差之间达到最优平衡的子样大小。
- 增加子样数量可一致提升准确性,表明集成平均显著增强了鲁棒性。
- 在给定置信水平下,可靠排除异常值所需的最少子样数量可进行解析推导,并可直接应用于实际场景。
- SubTSBR成功从含随机初始条件的噪声数据中发现鱼群捕捞常微分方程的正确形式(dN/dt = -2.818 + 3.837N - 0.965N²)。
- SubTSBR发现的模型能准确预测训练范围外的初始条件下的系统行为,而最小二乘回归则无法实现泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。