[论文解读] A Flexible Framework for Designing Trainable Priors with Adaptive Smoothing and Game Encoding
该论文提出了一种灵活且端到端可训练的框架,通过博弈论公式化将神经网络层解释为通过自适应平滑和正则化求解非光滑凸优化问题。该框架能够将多种可解释的图像先验(如总变差、双边滤波和非局部自相似性)整合到深度学习模型中,在参数量减少高达50倍的同时实现最先进性能,并提升数据效率。
We introduce a general framework for designing and training neural network layers whose forward passes can be interpreted as solving non-smooth convex optimization problems, and whose architectures are derived from an optimization algorithm. We focus on convex games, solved by local agents represented by the nodes of a graph and interacting through regularization functions. This approach is appealing for solving imaging problems, as it allows the use of classical image priors within deep models that are trainable end to end. The priors used in this presentation include variants of total variation, Laplacian regularization, bilateral filtering, sparse coding on learned dictionaries, and non-local self similarities. Our models are fully interpretable as well as parameter and data efficient. Our experiments demonstrate their effectiveness on a large diversity of tasks ranging from image denoising and compressed sensing for fMRI to dense stereo matching.
研究动机与目标
- 开发一种通用且可解释的框架,用于将特定领域的图像先验整合到端到端可训练的深度神经网络中。
- 克服现有方法依赖简单可微分先验或缺乏可解释性的局限。
- 实现对复杂、非光滑正则化函数(如总变差和非局部自相似性)的高效学习。
- 提升数据效率和参数效率,尤其在医学或科学成像中常见的低数据场景下。
- 通过优化展开提供神经网络决策的数学基础和功能解释。
提出的方法
- 将图像复原建模为图中各节点(局部代理)之间的非合作凸博弈,每个节点通过共享正则化求解局部优化问题。
- 采用Moreau-Yosida正则化技术处理总变差和ℓ1-范数等非光滑项,实现可微分优化。
- 将所得优化算法展开为神经网络架构,其中各层对应算法的迭代步骤。
- 引入自适应平滑和博弈编码,动态调节正则化强度及远距离图像块之间的交互。
- 采用双层优化设置,联合从数据中学习模型参数和正则化函数的结构。
- 在统一的可训练框架中支持多种先验的集成,例如稀疏编码、拉普拉斯正则化和非局部自相似性。
实验结果
研究问题
- RQ1是否能够通过统一框架实现复杂、非光滑图像先验的端到端训练,同时保持可解释性?
- RQ2博弈论正则化机制的引入在低数据或高复杂度成像任务中是否能提升性能?
- RQ3基于博弈框架的自适应平滑与非局部交互是否能在参数量远少于标准深度网络的情况下表现更优?
- RQ4该框架在去噪、fMRI重建和立体匹配等多样化成像任务中具有多大程度的泛化能力?
- RQ5与标准CNN相比,该模型在有限训练数据下的性能扩展特性如何?
主要发现
- 所提框架在图像去噪、压缩fMRI重建和密集立体匹配任务中均取得具有竞争力的性能,达到或超越当前最先进水平。
- 采用非局部自相似性正则化的可训练总变差变体在KITTI2015立体匹配任务中实现2.10 ± 0.03的3像素误差,参数量仅为PSMNet的1/50,性能更优。
- 在低数据场景下,该模型与CNN基线的性能差距进一步扩大,表明其具有更优的数据效率——这对医学成像至关重要。
- 与标准CNN相比,该框架将参数量减少高达50倍,同时保持或提升准确率。
- 将TV模块集成到预训练立体匹配模型中,在10次运行中均一致提升性能,且额外参数极少。
- 该方法实现了具有明确数学语义的可解释模型的端到端训练,降低了对黑箱架构的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。