Skip to main content
QUICK REVIEW

[論文レビュー] UniT: Multimodal Multitask Learning with a Unified Transformer

Ronghang Hu, Amanpreet Singh|arXiv (Cornell University)|Feb 22, 2021
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

UniTは、視覚のみ(オブジェクト検出)や言語のみ(GLUEベンチマーク)からマルチモーダル(VQA、視覚的含意)まで多様な7つのタスクを統合的に学習するための統一されたトランスフォーマー・アーキテクチャを提案する。共有エンコーダ・デコーダ構造とタスク固有のヘッドを用い、タスク間でパラメータを共有することで、タスク固有のモデルよりも大幅に少ないパラメータで、すべてのタスクで優れた性能を達成した。これは、1つのエンドツーエンドモデル内で、複数のドメイン・複数のタスク学習が有効に実現されていることを示している。

ABSTRACT

We propose UniT, a Unified Transformer model to simultaneously learn the most prominent tasks across different domains, ranging from object detection to natural language understanding and multimodal reasoning. Based on the transformer encoder-decoder architecture, our UniT model encodes each input modality with an encoder and makes predictions on each task with a shared decoder over the encoded input representations, followed by task-specific output heads. The entire model is jointly trained end-to-end with losses from each task. Compared to previous efforts on multi-task learning with transformers, we share the same model parameters across all tasks instead of separately fine-tuning task-specific models and handle a much higher variety of tasks across different domains. In our experiments, we learn 7 tasks jointly over 8 datasets, achieving strong performance on each task with significantly fewer parameters. Our code is available in MMF at https://mmf.sh.

研究の動機と目的

  • 視覚、言語、マルチモーダル推論の分野にまたがる多様なタスクを同時に学習可能な1つの統一されたトランスフォーマー・モデルの開発。
  • 各タスクごとに別々のモデルを学習するのではなく、すべてのタスクでパラメータを共有することでモデルの複雑さを低減すること。
  • 1つのアーキテクチャと共有パラメータを用いて、異種の複数のタスクをエンドツーエンドで共同学習すること。
  • 異なるモダリティやドメインにまたがるマルチタスク学習が性能と一般化能力を向上させるかどうかを調査すること。
  • 共有表現が単一モダリティとマルチモダリティのタスク間での転移を可能にする有効性を評価すること。

提案手法

  • 画像とテキスト入力を処理するための別々の視覚的・言語的エンコーダを用い、文脈に応じた表現に変換する。
  • 共有トランスフォーマー・デコーダが、すべてのモダリティからのエンコード済み表現に注目し、タスク固有の出力を生成する。
  • 各タスクは、デコーダの最終隠れ状態にタスク固有の出力ヘッドを適用して予測を生成する。
  • 全モデルは、すべてのタスクからの損失を統合した組み合わせ損失関数を用いてエンドツーエンドで訓練される。
  • タスク固有の埋め込みを用いて、デコーダをターゲットタスクに適合させ、同じアーキテクチャ内で異なるタスクに適応可能にする。
  • エンコーダおよびデコーダのすべてのパラメータをタスク間で共有することで、モデルサイズを最小限に抑えつつ、パラメータ効率の良いマルチタスク学習を実現する。
Figure 2: An overview of our UniT model, which jointly handles a wide range of tasks in different domains with a unified transformer encoder-decoder architecture. Our model uses an image encoder to encode the visual inputs (Sec. 3.1 ), a text encoder to encode the language inputs (Sec. 3.2 ), and a
Figure 2: An overview of our UniT model, which jointly handles a wide range of tasks in different domains with a unified transformer encoder-decoder architecture. Our model uses an image encoder to encode the visual inputs (Sec. 3.1 ), a text encoder to encode the language inputs (Sec. 3.2 ), and a

実験結果

リサーチクエスチョン

  • RQ11つのトランスフォーマー・モデルが、視覚、言語、マルチモーダル推論の分野にまたがる多様なタスクを同時に効果的に学習・実行できるか?
  • RQ2例えばオブジェクト検出と自然言語推論といった異種のタスクを共同で学習することで、タスク固有のモデルと比較して性能が向上するか?
  • RQ3タスク間でパラメータを共有することで、モデルサイズを小さくしつつ、すべてのタスクで優れた性能を維持できるか?
  • RQ4単一モダリティとマルチモダリティのタスクを併せて学習するマルチタスク学習が、個々のタスクの性能に与える影響はいかほどか?
  • RQ5安定的かつ効果的な共同学習を実現するにあたり、ハイパーパrameterやアーキテクチャ的選択(例:デコーダの深さ、損失重み付け)で最も重要となる要因は何か?

主な発見

  • UniTは、オブジェクト検出、VQA、視覚的含意、GLUEベンチマークのタスクを含む7つのタスクすべてで、タスク固有のモデルよりも大幅に少ないパラメータを用いた1つの共有モデルで優れた性能を達成した。
  • 統一されたアーキテクチャと共有ハイパーパramータを用いても、DETR、VisualBERT、BERTといった専用の最先端モデルと同等の性能を示した。
  • マルチタスク学習により、オブジェクト検出や自然言語推論といった単一モダリティのタスクと併せて学習することで、VQA や視覚的含意といったマルチモーダルタスクの性能が向上した。
  • アブレーションスタディの結果、デコーダの深さや隠れ層サイズを増やすことで検出性能が向上するが、大きすぎるサイズは学習の発散を引き起こすことが判明した。
  • BERTエンコーダの出力を[CLS]トークンのみではなく、すべての出力に使用することで、性能にほとんど影響を与えず、計算コストが増加するだけであった。
  • 安定した学習には、学習率(5e-5)を小さくし、バッチサイズも小さくする必要がある。大きな値を設定すると、学習が不安定になり発散する。
Figure 3: Predictions of our model with a shared decoder (Table 3 line 5) across 8 datasets. Our model jointly handles a large variety of tasks above through a unified transformer encoder-decoder architecture.
Figure 3: Predictions of our model with a shared decoder (Table 3 line 5) across 8 datasets. Our model jointly handles a large variety of tasks above through a unified transformer encoder-decoder architecture.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。