Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Task Self-Training for Learning General Representations

Golnaz Ghiasi, Barret Zoph|arXiv (Cornell University)|Aug 25, 2021
Advanced Neural Network Applications参考文献 63被引用数 5
ひとこと要約

本論文では、共有のラベルなしデータセットからの仮ラベルを用いて、独立して訓練された専門的教師モデルから知識を蒸留することで、1つの汎用的Studentモデルに知識を統合するMulti-Task Self-Training (MuST) を提案する。MuSTは、大規模データで訓練された場合、分類、検出、セグメンテーション、深度推定、表面法線予測など6つの視覚タスクにおいて、特化型の教師モデルやSimCLRのような自己教師学習手法を上回る最先端の性能を達成する。

ABSTRACT

Despite the fast progress in training specialized models for various tasks, learning a single general model that works well for many tasks is still challenging for computer vision. Here we introduce multi-task self-training (MuST), which harnesses the knowledge in independent specialized teacher models (e.g., ImageNet model on classification) to train a single general student model. Our approach has three steps. First, we train specialized teachers independently on labeled datasets. We then use the specialized teachers to label an unlabeled dataset to create a multi-task pseudo labeled dataset. Finally, the dataset, which now contains pseudo labels from teacher models trained on different datasets/tasks, is then used to train a student model with multi-task learning. We evaluate the feature representations of the student model on 6 vision tasks including image recognition (classification, detection, segmentation)and 3D geometry estimation (depth and surface normal estimation). MuST is scalable with unlabeled or partially labeled datasets and outperforms both specialized supervised models and self-supervised models when training on large scale datasets. Lastly, we show MuST can improve upon already strong checkpoints trained with billions of examples. The results suggest self-training is a promising direction to aggregate labeled and unlabeled training data for learning general feature representations.

研究の動機と目的

  • 多様なタスクにわたって優れた性能を発揮する1つの汎用的視覚モデルを学習する課題に対処すること。
  • コンピュータビジョン分野における大規模マルチタスクデータセットのデータ不足とアノテーション負荷の課題を克服すること。
  • 専門的教師モデルから得られる仮ラベルが、統一された学生モデルに効果的に知識を転送できるかを検討すること。
  • マルチタスク自己学習が、教師ありまたは自己教師学習の事前学習よりも優れた汎用的表現を生み出せるかを評価すること。

提案手法

  • 分類(例:ImageNet)、検出(例:COCO)、深度推定(例:MiDaS)などの特定タスク向けに、ラベル付きデータセット上で独立して訓練された専門的教師モデルを訓練する。
  • 訓練済みの教師モデルを用いて、大規模な共有のラベルなしデータセット(例:ImageNet)上でマルチタスクの仮ラベルを生成する。
  • 共有のResNet-FPNバックボーンとタスク固有のヘッドを備えた、仮ラベル付きデータセット上でエンドツーエンドに訓練される1つの汎用的Studentモデルを、マルチタスク学習により訓練する。
  • 学生モデルの訓練中にデータ拡張やラベルスムージングを適用せず、スケールジッタリングと標準的な訓練プロトコルを適用する。
  • 最適なパフォーマンスを得るためにハイパーパramーターサーチを用いて、下流タスクで学生モデルをファインチューニングする。
  • タスク間で特徴を共有するシンプルなモデルアーキテクチャを用いることで、効率的に汎用的表現を学習する。
Figure 1: An overview of Multi-Task Self-Training (MuST). Specialized Teacher represents a supervised model trained on a single task and dataset ( e.g . , classification model trained on ImageNet). Specialized Teacher models are trained independently on their own tasks and datasets. They then genera
Figure 1: An overview of Multi-Task Self-Training (MuST). Specialized Teacher represents a supervised model trained on a single task and dataset ( e.g . , classification model trained on ImageNet). Specialized Teacher models are trained independently on their own tasks and datasets. They then genera

実験結果

リサーチクエスチョン

  • RQ1複数の専門的教師モデルからの仮ラベルを活用することで、1つの学生モデルが汎用的視覚表現を学習できるか?
  • RQ2マルチタスク自己学習が、下流の視覚タスクにおいて教師ありおよび自己教師学習の事前学習を上回る性能を発揮するか?
  • RQ3大規模または部分的にラベル付きのデータセットに対して、MuSTは効果的にスケーリング可能で一般化性能を向上させられるか?
  • RQ4直接的なマルチタスクアノテーションがなくても、多様な教師モデルからの知識が統一された学生モデルに転送可能か?

主な発見

  • MuSTの学生モデルは、分類、検出、セグメンテーション、深度推定、表面法線予測を含む6つの視覚タスクにおいて、専門的教師モデルと同等またはそれ以上の性能を達成する。
  • PASCAL VOCセグメンテーションベンチマークでは、MuSTの学生モデルが53.8 mIoUを達成し、教師ありベースラインを上回り、専門的セマンティックセグメンテーション教師モデルと同等の性能を示した。
  • NYU Depth v2では、相対比1.25以内の深度精度が91.2%に達し、SimCLRを上回り、専門的MiDaS教師モデルと同等の性能を示した。
  • DIODE表面法線推定タスクでは、11.25°未満の角度誤差に対する精度が87.4%に達し、SimCLRおよび教師ありベースラインを上回った。
  • 数十億の例で事前学習された強力なImageNetチェックポイントを上回る性能を示し、大規模データにおけるスケーラビリティと有効性を実証した。
  • 教師モデルからの仮ラベルのみで訓練されたにもかかわらず、学生モデルは専門的教師モデルのほとんどに匹敵する転移性能を維持しており、仮ラベル蒸留の有効性が裏付けられた。
Figure 2: Examples of pseudo labels on ImageNet. Left: bounding boxes labeled with an Objects365 teacher model. Middle: semantic segmentation labeled with a COCO teacher model. Right: depth labeled with a MiDaS teacher model.
Figure 2: Examples of pseudo labels on ImageNet. Left: bounding boxes labeled with an Objects365 teacher model. Middle: semantic segmentation labeled with a COCO teacher model. Right: depth labeled with a MiDaS teacher model.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。