Skip to main content
QUICK REVIEW

[论文解读] Maximum likelihood estimation of regularisation parameters in high-dimensional inverse problems: an empirical Bayesian approach. Part II: Theoretical Analysis

Valentin De Bortoli, Alain Durmus|arXiv (Cornell University)|Aug 13, 2020
Numerical methods in inverse problems参考文献 47被引用 4
一句话总结

本文针对高维反问题中正则化参数的最大边际似然估计,提供了随机逼近近端梯度方法的严格理论分析。在温和且可验证的条件下,该算法实现了几乎必然收敛,并给出了明确的非渐近收敛速率,采用不精确的近端马尔可夫链蒙特卡洛采样器(特别是近端朗之万算法),实现了高维场景下可扩展且理论可靠的优化。

ABSTRACT

This paper presents a detailed theoretical analysis of the three stochastic approximation proximal gradient algorithms proposed in our companion paper [49] to set regularization parameters by marginal maximum likelihood estimation. We prove the convergence of a more general stochastic approximation scheme that includes the three algorithms of [49] as special cases. This includes asymptotic and non-asymptotic convergence results with natural and easily verifiable conditions, as well as explicit bounds on the convergence rates. Importantly, the theory is also general in that it can be applied to other intractable optimisation problems. A main novelty of the work is that the stochastic gradient estimates of our scheme are constructed from inexact proximal Markov chain Monte Carlo samplers. This allows the use of samplers that scale efficiently to large problems and for which we have precise theoretical guarantees.

研究动机与目标

  • 建立高维反问题中边际似然优化的一般随机逼近方案的几乎必然收敛性。
  • 为所提出的算法提供易于验证的条件下明确的非渐近收敛速率。
  • 分析在高维设置中使用不精确近端MCMC采样器(如MYULA)进行梯度估计的方法的收敛性。
  • 将理论框架推广至超出合作者论文中三个特定算法的范围,使其作为特例涵盖。
  • 确保在病态或病态条件下的成像问题中优化的理论保证,其中正则化参数选择至关重要。

提出的方法

  • 提出一种通用的随机逼近方案,形式为:θn+1 = ΠΘ[θn − δn+1/mn ∑(g(Xn,k) − g(¯Xn,k))],其中(Xn,k)和(¯Xn,k)是针对后验与先验分布的不精确MCMC采样器。
  • 采用近端朗之万采样器(如MYULA)处理如总变差或ℓ1-范数等不可微正则化项,确保在高维中的可扩展性。
  • 使用具有可控偏差和方差的不精确MCMC采样器,其基于带近端步长的广义未调整朗之万算法(ULA)。
  • 应用费希尔恒等式,将对数边际似然的梯度表示为两个期望之差,通过MCMC样本进行估计。
  • 利用随机逼近理论框架建立收敛性,对步长序列和批量大小施加条件。
  • 通过分析转移核之间的Kullback-Leibler散度,结合广义Pinsker不等式和李雅普诺夫函数,推导出收敛速率的显式界。

实验结果

研究问题

  • RQ1在何种条件下,该随机逼近方案会以几乎必然收敛于边际似然最大化问题的解?
  • RQ2该算法的非渐近收敛速率是什么?其如何依赖于步长和批量大小序列?
  • RQ3使用不精确近端MCMC采样器如何影响优化方案的收敛特性?
  • RQ4该理论框架能否扩展至涵盖合作者论文中的多个算法作为特例?
  • RQ5在高维、不可微设置中使用近端朗之万采样器时,收敛所需的最小且可验证的假设是什么?

主要发现

  • 在温和的可积性与正则性条件下,所提出的随机逼近方案几乎必然收敛于边际似然最大化问题的解。
  • 建立了非渐近收敛速率,并给出了依赖于步长序列(δn)、批量大小(mn)以及MCMC采样器混合性质的显式界。
  • 在适当的步长与批量大小选择下,收敛速率被证明为O(1/√n),其显式依赖于目标分布的谱间隙与对数索波洛夫常数。
  • 使用不精确近端MCMC采样器(如MYULA)在理论上得到支持,其梯度估计的偏差与方差界随MCMC迭代次数递减。
  • 该理论适用于具有不可微正则化项(如TV、ℓ1)的广泛成像问题,实现了高维场景下可扩展且鲁棒的参数估计。
  • 为标准版与近端版的未调整朗之万算法建立了理论保证,其显式依赖于步长与正则化参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。