Skip to main content
QUICK REVIEW

[论文解读] Robust inversion via semistochastic dimensionality reduction

Aleksandr Y. Aravkin, Michael P. Friedlander|arXiv (Cornell University)|Oct 5, 2011
Sparse and Compressive Sensing TechniquesEngineering参考文献 21被引用 17
一句话总结

该论文提出了一种基于学生t分布惩罚项与随机采样半随机降维相结合的鲁棒反演框架,用于处理具有重尾噪声及高达50%数据被污染的大规模地震反演问题。该方法通过允许灵活的残差分布,在全波形反演实验中展现出优于最小二乘法和Huber惩罚项的收敛性与准确性,采用有限内存BFGS方法与自适应采样策略进行验证。

ABSTRACT

We consider a class of inverse problems where it is possible to aggregate the results of multiple experiments. This class includes problems where the forward model is the solution operator to linear ODEs or PDEs. The tremendous size of such problems motivates dimensionality reduction techniques based on randomly mixing experiments. These techniques break down, however, when robust data-fitting formulations are used, which are essential in cases of missing data, unusually large errors, and systematic features in the data unexplained by the forward model. We survey robust methods within a statistical framework, and propose a semistochastic optimization approach that allows dimensionality reduction. The efficacy of the methods are demonstrated for a large-scale seismic inverse problem using the robust Student's t-distribution, where a useful synthetic velocity model is recovered in the extreme scenario of 60% data missing at random. The semistochastic approach achieves this recovery using 20% of the effort required by a direct robust approach.

研究动机与目标

  • 解决最小二乘法与Huber惩罚项在处理大规模反演问题中重尾噪声与异常值时的局限性。
  • 基于学生t分布开发一种鲁棒估计框架,以更好地模拟真实世界数据中的伪影与异常值。
  • 通过随机采样实现降维,以降低计算成本,同时保持收敛性特征。
  • 利用随机优化技术实现可扩展、高效的全波形地震成像反演,适用于大规模数据集。
  • 在数据被污染条件下,通过模型精度与鲁棒性对比,证明所提方法优于经典方法。

提出的方法

  • 基于学生t分布推导出鲁棒惩罚函数,用于建模残差,无需假设噪声服从高斯分布或拉普拉斯分布。
  • 通过形成数据组(元实验)的加权平均,应用半随机降维策略,以减小问题规模,同时保持统计特性。
  • 利用随机采样近似全梯度,在随机优化中,每次迭代采样一个小型且动态增大的实验批次。
  • 采用有限内存BFGS拟牛顿法,结合自适应Hessian近似,以加速收敛,同时保持低内存占用。
  • 在采样目标函数上使用Armijo回溯线搜索,以确保每一步均实现目标函数的充分下降。
  • 基于对梯度误差二阶矩的理论界,确保收敛期望,依据至最优解的期望距离。

实验结果

研究问题

  • RQ1基于学生t分布的鲁棒惩罚是否能在存在异常值与数据污染的情况下,优于经典的最小二乘法与Huber惩罚?
  • RQ2随机采样与降维结合在保持大规模反演问题的收敛速度与解精度方面效果如何?
  • RQ3所提出的半随机方法在降低每次迭代成本的同时,能在多大程度上保持全梯度方法的收敛速率?
  • RQ4在不同惩罚函数下,优化过程中的残差分布如何演化?学生t惩罚是否允许更真实的残差形态?
  • RQ5自适应批量大小与随机Hessian近似对优化算法收敛行为有何影响?

主要发现

  • 学生t惩罚项实现了最佳的模型重建精度,相对模型误差随迭代稳步下降,且在所有测试方法中保持最低。
  • 最小二乘法优化未能降低模型误差,表明其对50%数据污染与非高斯噪声的鲁棒性差。
  • Huber惩罚初始阶段表现改善,但在约20次迭代后误差开始上升,表明对异常值分布敏感。
  • 基于采样的优化方法在收敛速度上与全梯度方法相当,同时保持了较低的每次迭代计算成本。
  • 采样数据规模每轮迭代逐步增加一个元素,表明采用了受控且自适应的采样策略。
  • 50次迭代后残差的直方图显示,仅学生t惩罚允许残差分布演化为真实的重尾分布,而高斯或拉普拉斯先验强制了不自然的分布形态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。