Skip to main content
QUICK REVIEW

[论文解读] Transformer Neural Processes: Uncertainty-Aware Meta Learning Via Sequence Modeling

Tung Nguyen, Aditya Grover|arXiv (Cornell University)|Jul 9, 2022
Gaussian Processes and Bayesian Inference被引用 11
一句话总结

本文提出了一种新型的不确定性感知元学习框架——Transformer神经过程(TNPs),通过基于Transformer的架构将元学习建模为自回归序列建模问题。与使用变分下界不同,TNPs通过优化精确的条件似然,实现了在元回归、图像补全、上下文Bandit问题以及贝叶斯优化任务上的最先进性能,相较于先前的NP变体,其在不确定性校准和表达能力方面均有显著提升。

ABSTRACT

Neural Processes (NPs) are a popular class of approaches for meta-learning. Similar to Gaussian Processes (GPs), NPs define distributions over functions and can estimate uncertainty in their predictions. However, unlike GPs, NPs and their variants suffer from underfitting and often have intractable likelihoods, which limit their applications in sequential decision making. We propose Transformer Neural Processes (TNPs), a new member of the NP family that casts uncertainty-aware meta learning as a sequence modeling problem. We learn TNPs via an autoregressive likelihood-based objective and instantiate it with a novel transformer-based architecture. The model architecture respects the inductive biases inherent to the problem structure, such as invariance to the observed data points and equivariance to the unobserved points. We further investigate knobs within the TNP framework that tradeoff expressivity of the decoding distribution with extra computation. Empirically, we show that TNPs achieve state-of-the-art performance on various benchmark problems, outperforming all previous NP variants on meta regression, image completion, contextual multi-armed bandits, and Bayesian optimization.

研究动机与目标

  • 为解决神经过程(NPs)在不确定性感知元学习设置中存在似然不可计算和欠拟合的问题。
  • 通过将元学习建模为自回归序列建模问题,消除对潜在变量和变分近似的依赖。
  • 设计一种尊重上下文点排列不变性和目标点排列等变性的Transformer架构,确保与函数不确定性的一致性结构。
  • 通过预测协方差矩阵的近似方法,研究预测表达能力与计算效率之间的权衡。
  • 在基准任务上实证验证TNPs,包括元回归、图像补全、上下文Bandit问题以及贝叶斯优化。

提出的方法

  • TNPs通过自回归目标建模给定上下文点的目标点条件对数似然,避免使用变分推断和潜在变量。
  • 模型采用带有因果掩码的Transformer主干网络,类似于GPT,以支持预测的自回归生成。
  • 移除位置嵌入,并引入一种新型的填充与掩码机制,以确保对上下文点顺序的不变性以及对目标点顺序的等变性。
  • 使用蒙特卡洛近似对预测分布进行对称化处理,从设计上保证等变性。
  • 提出两种变体——TNP-D与TNP-ND,分别采用对角矩阵和Cholesky分解对预测协方差矩阵进行近似,以在表达能力与计算成本之间实现权衡。
  • 通过联合预测分布的自回归因子分解进行端到端最大似然训练。

实验结果

研究问题

  • RQ1与基于潜在变量的神经过程相比,使用Transformer进行自回归建模是否能提升元学习中的不确定性校准与预测性能?
  • RQ2通过直接最大化似然而非使用变分推断和潜在变量,是否能提升元学习任务中的泛化能力并减少欠拟合?
  • RQ3如何修改基于Transformer的架构,以满足神经过程所要求的功能不变性与等变性,如上下文点的排列不变性与目标点的等变性?
  • RQ4在解码分布中对完整预测协方差矩阵进行近似时,预测表达能力与计算效率之间的权衡如何?
  • RQ5TNP变体是否能在上下文Bandit问题和贝叶斯优化等序列决策任务中实现优异性能,其中不确定性量化至关重要?

主要发现

  • TNPs在元回归基准任务上达到最先进性能,优于所有先前的NP变体,包括基于注意力机制(如ANP)和非注意力模型。
  • 在图像补全任务中,TNPs展现出更优的重建质量与更优的不确定性校准性能,优于现有基于NP的方法。
  • 在上下文多臂Bandit设置中,TNPs表现出更低的累积遗憾,表明其在不确定性感知探索与决策方面更具优势。
  • 在贝叶斯优化任务中,TNPs相比先前的基于NP的方法实现了更低的遗憾与更快的收敛速度,验证了其在不确定性下序列决策的有效性。
  • TNP-D与TNP-ND变体在计算成本降低的同时仍保持优异性能,表明精确等变性与可计算性可被有效平衡。
  • 实证结果证实,TNPs的性能提升并非单纯源于模型容量的增加,而是源于自回归建模、架构归纳偏置与精确似然优化的协同作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。