Skip to main content
QUICK REVIEW

[論文レビュー] Information-Theoretic Analysis of Epistemic Uncertainty in Bayesian Meta-learning

Sharu Theresa Jose, Sangwoo Park|arXiv (Cornell University)|Jun 1, 2021
Gaussian Processes and Bayesian Inference参考文献 41被引用数 4
ひとこと要約

本稿は、ベイジアンメタラーニングにおける認識的不確実性の情報理論的分析を提示し、条件付き相互情報量を用いて最小過剰メタリスク(MEMR)の正確な特徴付けと上限を導出する。認識的不確実性は、ハイパーパramータの不確実性に起因して $ O(d/\log(N)/N) $ のスケーリングを示し、モデルパラメータの不確実性に起因して $ O(d/\log(m)/m) $ のスケーリングを示す。実験により、タスクごとのデータが限られる状況ではメタラーニングが不確実性を低減することが確認されたが、データが豊富な場合にはその恩恵が得られないことが示された。

ABSTRACT

The overall predictive uncertainty of a trained predictor can be decomposed into separate contributions due to epistemic and aleatoric uncertainty. Under a Bayesian formulation, assuming a well-specified model, the two contributions can be exactly expressed (for the log-loss) or bounded (for more general losses) in terms of information-theoretic quantities (Xu and Raginsky, 2020). This paper addresses the study of epistemic uncertainty within an information-theoretic framework in the broader setting of Bayesian meta-learning. A general hierarchical Bayesian model is assumed in which hyperparameters determine the per-task priors of the model parameters. Exact characterizations (for the log-loss) and bounds (for more general losses) are derived for the epistemic uncertainty -quantified by the minimum excess meta-risk (MEMR)- of optimal meta-learning rules. This characterization is leveraged to bring insights into the dependence of the epistemic uncertainty on the number of tasks and on the amount of per-task training data. Experiments are presented that use the proposed information-theoretic bounds, evaluated via neural mutual information estimators, to compare the performance of conventional learning and meta-learning as the number of meta-learning tasks increases.

研究の動機と目的

  • 従来のベイジアン学習における情報理論的不確実性分解を、ベイジアンメタラーニングへと拡張すること。
  • 対数損失下での最小過剰メタリスク(MEMR)を用いて、メタラーニングにおける認識的不確実性を特徴付けること。
  • 認識的不確実性がメタトレーニングタスク数 $ N $ およびタスクごとのデータ数 $ m $ にどのように依存するかを定量化すること。
  • ニューラル相互情報量推定器(例:C-MINE)を用いて、提案された上限をベイジアンニューラルネットワーク設定で評価すること。
  • $ N $ が増加する際の従来学習とメタラーニングの性能を比較し、メタラーニングが顕著な利点を示す領域を同定すること。

提案手法

  • ハイパーパramータ $ U $、タスク固有パラメータ $ W $、タスク固有データ $ \mathbf{Z} $ を有する階層的モデルを用いて、ベイジアンメタラーニングを形式化し、モデルが適切に指定されていると仮定する。
  • 対数損失におけるMEMRの正確な情報理論的特徴付けを、二つの条件付き相互情報量項の和として導出する:$ I(Y;W|X,\mathbf{Z},U) $ および $ I(Y;U|X,\mathbf{Z}_{1:N}) $。
  • 情報理論的ツールを用いて一般損失関数に対するMEMRの上界を確立し、最小過剰リスク(MER)概念を一般化する。
  • 関連する条件付き相互情報量項をニューラル推定器を用いて推定することを提案し、特にC-MINEとSMILEを用いて上限を実験的に評価する。
  • 3層のMLP(ReLU活性化関数を備える)を用いたベイジアンニューラルネットワーク(BNN)を用いた実験を設計し、$ N $ と $ m $ を変化させた際のMEMRおよびその上限を比較する。
  • C-MINEにおける3層分類器をReLU活性化関数とAdam最適化を用いて、モデルパラメータとトレーニングデータ間の相互情報量を推定する。

実験結果

リサーチクエスチョン

  • RQ1ベイジアンメタラーニングにおける認識的不確実性は、メタトレーニングタスク数 $ N $ およびタスクごとのデータ数 $ m $ とどのようにスケーリングされるか?
  • RQ2階層的ベイジアンモデルにおける最小過剰メタリスク(MEMR)の情報理論的構造は何か?
  • RQ3どのような状況下でメタラーニングが従来学習よりも顕著に認識的不確実性を低減するのか?
  • RQ4ハイパーパramータレベルとモデルパラメータレベルの不確実性がMEMRに与える寄与は、$ N $ と $ m $ に伴いどのように変化するか?
  • RQ5ニューラル相互情報量推定器は、BNN設定において導出された情報理論的上限を正確に評価できるか?

主な発見

  • ハイパーパラメータの不確実性に起因する認識的不確実性は $ O(d\log(N)/N) $ のスケーリングを示し、より多くのメタトレーニングタスクにより減少する。
  • モデルパラメータの不確実性に起因する認識的不確実性は $ O(d\log(m)/m) $ のスケーリングを示し、より多くのタスクごとのデータにより減少する。
  • タスクごとのデータ $ m $ が小さい場合(例:$ m < 10 $)、ハイパーパラメータレベルの感度が支配的となり、$ N $ が大きなメタラーニングによりMEMRが顕著に低減される。
  • タスクごとのデータ $ m $ が大きい場合(例:$ m > 75 $)、モデルパラメータレベルの感度が支配的となり、$ N $ を増加させても従来学習に対する利点は限定的である。
  • 大規模な $ N $ の極限においてもMEMRが消えないのは、$ N $ とは無関係に限られたタスクごとのデータ $ m $ に起因する持続的不確実性に起因する。
  • C-MINEおよびSMILE推定器を用いた実験により、MEMRおよびその上界が $ N $ と $ m $ に伴い減少することが確認され、すべての状況で上界が真のMEMRをよく追跡している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。