Skip to main content
QUICK REVIEW

[論文レビュー] Meta-Transfer Learning through Hard Tasks

Qianru Sun, Yaoyao Liu|arXiv (Cornell University)|Oct 7, 2019
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、事前学習済みDNN重みのためのタスク固有のスケーリングおよびシフト関数を学習することで、深層ニューラルネットワーク(DNN)が少サンプルタスクに素早く適応できる、新しいメタラーニングフレームワークであるメタ転送学習(MTL)を提案する。ハードタスク(HT)メタバッチカリキュラムを導入することで、miniImageNet、tieredImageNet、Fewshot-CIFAR100で最先端の性能を達成し、FC100では最大1.85%の精度向上を達成。収束にはたった8,000タスクで済み、MAMLの240,000タスクよりも大幅に少ない。

ABSTRACT

Meta-learning has been proposed as a framework to address the challenging few-shot learning setting. The key idea is to leverage a large number of similar few-shot tasks in order to learn how to adapt a base-learner to a new task for which only a few labeled samples are available. As deep neural networks (DNNs) tend to overfit using a few samples only, typical meta-learning models use shallow neural networks, thus limiting its effectiveness. In order to achieve top performance, some recent works tried to use the DNNs pre-trained on large-scale datasets but mostly in straight-forward manners, e.g., (1) taking their weights as a warm start of meta-training, and (2) freezing their convolutional layers as the feature extractor of base-learners. In this paper, we propose a novel approach called meta-transfer learning (MTL) which learns to transfer the weights of a deep NN for few-shot learning tasks. Specifically, meta refers to training multiple tasks, and transfer is achieved by learning scaling and shifting functions of DNN weights for each task. In addition, we introduce the hard task (HT) meta-batch scheme as an effective learning curriculum that further boosts the learning efficiency of MTL. We conduct few-shot learning experiments and report top performance for five-class few-shot recognition tasks on three challenging benchmarks: miniImageNet, tieredImageNet and Fewshot-CIFAR100 (FC100). Extensive comparisons to related works validate that our MTL approach trained with the proposed HT meta-batch scheme achieves top performance. An ablation study also shows that both components contribute to fast convergence and high accuracy.

研究の動機と目的

  • 限られたラベル付きデータを用いた少サンプル学習において、深層ニューラルネットワーク(DNN)を用いる際の過学習の課題に対処すること。
  • 浅いネットワークに依存するか、DNNの非効率なファインチューニングに依存する既存のメタラーニング手法の限界を克服すること。
  • 完全なファインチューニングを伴わずに、事前学習済みDNNを知識ベースとして活用し、少サンプル一般化性能を向上させること。
  • ハードタスクを用いた効率的なトレーニングカリキュラムを設計し、収束を加速させ、性能を向上させること。
  • 異なるアーキテクチャおよび学習パラダイム(教師ありおよび半教師あり少サンプル学習を含む)にわたるMTLの一般化を実証すること。

提案手法

  • すべてのパラメータをファインチューニングするのではなく、事前学習済みDNN重みのためのタスク固有のスケーリングおよびシフト関数を学習する、メタ転送学習(MTL)を提案する。
  • 特徴抽出器Θおよび分類器θの両方に対してスケーリングおよびシフト(SS)操作を適用し、最小限の学習可能なパラメータで効率的な適応を可能にする。
  • メタトレーニング中に困難なタスクを優先することでカリキュラムとして機能するハードタスク(HT)メタバッチ方式を導入する。
  • 2ループ最適化を用いてメタラーナーをトレーニングする:内側のループでベースラーナーが少サンプルタスクに適応し、外側のループでバリデーション性能を用いてメタパラメータを更新する。
  • バックボーンネットワークとして事前学習済みResNet-12、ResNet-18、ResNet-25を用い、メタトレーニング中はスケーリングおよびシフトパラメータのみを更新する。
  • 異なるベースラーナーの種類に適応可能なSS操作を用いることで、MTLフレームワークを教師ありおよび半教師あり少サンプル学習に一般化する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みDNNにスケーリングおよびシフト関数を適用するメタ転送学習は、標準的なファインチューニングおよびメタラーニングベースラインを上回る性能を少サンプル学習で達成できるか?
  • RQ2提案されたハードタスク(HT)メタバッチカリキュラムは、従来のメタバッチサンプリングと比較して収束を加速させ、精度を向上させるか?
  • RQ3MTLは、少サンプル設定下で異なるDNNアーキテクチャ(例:ResNet-12、ResNet-18、ResNet-25)に適用された場合に、どの程度効果的か?
  • RQ4MTLは、教師ありおよび半教師あり少サンプル学習の両方のパラダイムにおいて一貫して性能を向上させることができるか?
  • RQ5HTメタバッチ方式は、FC100のようなより困難なベンチマークにおいて、学習効率をどの程度向上させるか?

主な発見

  • SS[Θ;θ]を用いたMTLは、miniImageNet、tieredImageNet、Fewshot-CIFAR100で最先端の性能を達成し、1ショットminiImageNetではメタラーニングなしのケースと比較して10.6%の精度向上を達成した。
  • HTメタバッチ方式により、ベンチマーク全体で0.6%〜2.2%の精度向上が見られ、より困難なFC100では平均で1.85%の向上を記録した。
  • MTLは、miniImageNetでは約8,000タスク、FC100では約6,000タスクで収束し、MAMLの240,000タスクと比べて顕著な改善を示した。
  • 事前学習済み特徴抽出器Θを固定し、分類器θ(SS経由)のみをメタラーニングすることで、1ショットminiImageNetで完全なファインチューニングよりも約5%の性能向上を達成した。
  • HTメタバッチは、すべてのモデルおよびベンチマークでバリデーション性能を一貫して向上させ、特にFC100で最大の向上が観察された。
  • MTLフレームワークは良好に一般化可能であり、古典的な教師ありおよび最先端の半教師あり少サンプル学習モデルの両方で性能向上を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。