Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Neural Processes: Uncertainty-Aware Meta Learning Via Sequence Modeling

Tung Nguyen, Aditya Grover|arXiv (Cornell University)|Jul 9, 2022
Gaussian Processes and Bayesian Inference被引用数 11
ひとこと要約

本稿では、変換器ベースのアーキテクチャを用いて、自己回帰的系列モデル化問題としてメタラーニングを定式化する、不確実性を考慮したメタラーニングフレームワーク「変換器ニューラルプロセス(TNPs)」を提案する。変分下界ではなく正確な条件付き尤度を最適化することで、メタ回帰、画像補完、文脈的バンディット、ベイズ最適化の分野で最先端の性能を達成し、不確実性のキャリブレーションと表現力の向上により、先行するNPバージョンを上回っている。

ABSTRACT

Neural Processes (NPs) are a popular class of approaches for meta-learning. Similar to Gaussian Processes (GPs), NPs define distributions over functions and can estimate uncertainty in their predictions. However, unlike GPs, NPs and their variants suffer from underfitting and often have intractable likelihoods, which limit their applications in sequential decision making. We propose Transformer Neural Processes (TNPs), a new member of the NP family that casts uncertainty-aware meta learning as a sequence modeling problem. We learn TNPs via an autoregressive likelihood-based objective and instantiate it with a novel transformer-based architecture. The model architecture respects the inductive biases inherent to the problem structure, such as invariance to the observed data points and equivariance to the unobserved points. We further investigate knobs within the TNP framework that tradeoff expressivity of the decoding distribution with extra computation. Empirically, we show that TNPs achieve state-of-the-art performance on various benchmark problems, outperforming all previous NP variants on meta regression, image completion, contextual multi-armed bandits, and Bayesian optimization.

研究の動機と目的

  • ニューラルプロセス(NPs)の限界、特に計算不能な尤度と不足適合の問題を、不確実性を考慮したメタラーニング設定において解決すること。
  • 潜在変数と変分近似に依存することを排除し、メタラーニングを自己回帰的系列モデル化問題として定式化すること。
  • コンテキスト点の順序に対して不変で、ターゲット点の順序に対して等長性を満たす変換器ベースのアーキテクチャを設計し、関数的不確実性と構造的一致性を保証すること。
  • 予測共分散行列の近似を通じて、予測表現力と計算効率のトレードオフを調査すること。
  • メタ回帰、画像補完、文脈的バンディット、ベイズ最適化を含むベンチマークタスク上でTNPsを実証的に検証すること。

提案手法

  • TNPsは、コンテキスト点を条件としたターゲット点の条件付き対数尤度を、自己回帰的目的関数を用いてモデル化し、変分推論と潜在変数を回避する。
  • GPTに類似した因果マスクを備えた変換器バックボーンを用い、予測の自己回帰的生成を可能にする。
  • 位置埋め込みを削除し、コンテキスト点の順序に対して不変で、ターゲット点の順序に対して等長性を保証するための新しいパディングおよびマスク方式を導入する。
  • モンテカルロ近似を用いて予測分布を対称化し、設計上等長性を確保する。
  • 予測共分散行列の近似として対角行列とコレスキー分解を用いる2つのバージョン、TNP-DとTNP-NDを導入し、表現力と計算コストのトレードオフを実現する。
  • 予測分布の自己回帰的因子分解に基づく尤度推定を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1変換器を用いた自己回帰的モデリングは、潜在変数に基づくニューラルプロセスと比較して、メタラーニングにおける不確実性のキャリブレーションと予測性能を向上させることができるか?
  • RQ2変分推論と潜在変数を排除し、直接尤度最大化に移行することで、メタラーニングタスクにおける一般化性能の向上と不足適合の低減が達成できるか?
  • RQ3変換器ベースのアーキテクチャをどのように変更すれば、ニューラルプロセスに必要な関数的不変性(例:コンテキストの順列不変性)と等長性(例:ターゲットの順序に対する等長性)を満たすことができるか?
  • RQ4デコード分布における完全な予測共分散行列の近似を行う際、予測表現力と計算効率のトレードオフはどのように変化するか?
  • RQ5TNPバージョンは、不確実性の定量化が重要な逐次意思決定タスク(例:文脈的バンディットやベイズ最適化)において、優れた性能を達成できるか?

主な発見

  • TNPsは、先行するすべてのNPバージョン(例:注意機構付きのANPや非注意型モデルを含む)を上回る、メタ回帰ベンチマークで最先端の性能を達成した。
  • 画像補完タスクでは、既存のNPベース手法と比較して優れた再構成品質と不確実性キャリブレーションを示した。
  • 文脈的マルチアームバンディット設定では、累積的後悔が低く抑えられ、より優れた不確実性を考慮した探索と意思決定が可能であることが示された。
  • ベイズ最適化においては、以前のNPベースのアプローチよりも低い後悔と高速な収束を達成し、不確実性下での逐次意思決定における有効性が検証された。
  • TNP-DおよびTNP-NDバージョンは、計算コストを削減しつつも優れた性能を発揮し、正確な等長性と計算可能性のバランスが効果的に実現できることを示した。
  • 実証的結果から、TNPsの性能向上はモデル容量の増加に起因するものではなく、自己回帰的モデリング、アーキテクチャのインダクティブバイアス、正確な尤度最適化の組み合わせに起因することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。