Skip to main content
QUICK REVIEW

[論文レビュー] Uncertainty in Multitask Transfer Learning

Alexandre Lacoste, Boris N. Oreshkin|arXiv (Cornell University)|Jun 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 30被引用数 12
ひとこと要約

本論文は、階層ベイジアンニューラルネットワークを用いて、複数の多様なタスクから意味のある、タスクに依存しない事前分布を学習する、変分ベイズ手法であるDeep Priorを提案する。タスク固有のパラメータと共有パラメータを分離し、プロトタイプネットワークを用いたタスク条件付き処理を実施することで、5ショットMini-Imagenetで74.5%の最先端の正確度を達成し、MAMLや他のベースラインを上回った。特に、タスクが不均一な設定下で顕著な性能向上を示した。

ABSTRACT

Using variational Bayes neural networks, we develop an algorithm capable of accumulating knowledge into a prior from multiple different tasks. The result is a rich and meaningful prior capable of few-shot learning on new tasks. The posterior can go beyond the mean field approximation and yields good uncertainty on the performed experiments. Analysis on toy tasks shows that it can learn from significantly different tasks while finding similarities among them. Experiments of Mini-Imagenet yields the new state of the art with 74.5% accuracy on 5 shot learning. Finally, we provide experiments showing that other existing methods can fail to perform well in different benchmarks.

研究の動機と目的

  • 複数の多様なタスクから意味があり、柔軟な事前分布を学習するスケーラブルな手法を開発し、少データ一般化を向上させること。
  • タスクが不均一または著しく異なる場合に失敗する既存の転移学習手法の限界を克服すること。
  • ベイジアンニューラルネットワークを用いて、低データ環境下での不確実性推定と事後分布近似を効果的に行うこと。
  • 階層ベイジアンモデリングとタスク固有の適応メカニズムを組み合わせることで、少データ学習の性能を向上させること。
  • 単一表現モデルが不均一なベンチマークでは失敗することを示し、耐障害性のある転移学習にはタスク条件付き事前分布が必要であること。

提案手法

  • タスク固有の重み $w_j$ が共有事前分布 $p(w_j | \alpha)$ から抽出される階層ベイジアンフレームワークを採用し、$\alpha$ は複数のタスクから最尤推定(MAP)により学習される。
  • 変分ベイズを用いて事後分布 $p(w_j | \alpha, S_j)$ を近似し、不確実性推定と正則化を可能にする。
  • FILM層またはタスク埋め込みを用いたタスク条件付き処理を導入し、共有表現を用いて新しいタスクに適応可能にする。
  • 深層事前分布とプロトタイプネットワークを組み合わせることで、ノイズの多い最終層生成を回避し、学習安定性と性能を向上させる。
  • 小ショットデータセットでの過学習を防ぐために、事後分布にKL正則化を適用し、最適な重みはハイパーパramータチューニングにより特定する。
  • 訓練中にデータ漏洩を避けるために、テストデータに影響されないよう、タスク埋め込みの学習にリーブ・ワン・アウト手順を採用する。

実験結果

リサーチクエスチョン

  • RQ1多様なタスクにわたって学習された単一の共有事前分布は、転移学習における少データ一般化を改善できるか?
  • RQ2MAMLのような標準的な少データ学習手法は、タスクが著しく異なる場合にどの程度性能を低下させるか?
  • RQ3タスクが均一でない場合に、タスク条件付き処理が一般化性能にどの程度寄与するか?
  • RQ4豊富で構造的な事前分布を持つベイジアンニューラルネットワークは、低データ環境下で平均場近似を上回れるか?
  • RQ5単一の共有表現はすべてのタスクに十分か、それとも不均一なベンチマークではタスク固有の適応が必要か?

主な発見

  • 提案手法であるDeep Priorは、5ショットMini-Imagenetベンチマークで74.5%の正確度を達成し、MAML や Discriminative k-shot などの先行手法を上回り、新たな最先端を記録した。
  • 不均一なSynbolsベンチマークでは、フォントと記号のタスクを組み合わせた標準的なプロトタイプネットワークの正確度は76.8%に低下するが、条件付き処理を施したDeep Priorでは83.5%まで回復した。
  • アブレーションスタディにより、残差ネットワーク、タスク条件付き処理、リーブ・ワン・アウト訓練、KL正則化がすべて最適性能を達成するために不可欠であることが確認された。
  • MAMLがタスクが著しく異なる場合に性能を発揮できないことが実験で示され、より表現力のある事前分布の必要性が浮き彫りになった。
  • 実験により、単一の共有表現に依存するモデルは不均一なタスクでは失敗するが、タスク条件付き事前分布が耐障害性のある転移に不可欠であることが明らかになった。
  • Harmonicsデータセットにおける学習済み事前分布は意味のある構造を示しており、本手法がタスク間で共有されるインダクティブバイアスを効果的に捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。