[論文レビュー] MulT: An End-to-End Multitask Learning Transformer
MulTは、共有されたSwin変換器エンコーダーと、タスク固有のデコーダーヘッドに加え、タスク間で共有される注目メカニズムを備えた、エンドツーエンドのマルチタスク変換器フレームワークを提案する。このフレームワークは、深度推定、セマンティックセグメンテーション、再照明、表面法線推定、2次元キーポoin検出、エッジ検出の6つの高レベルビジョンタスクを同時に学習する。モデルは、単一タスクの変換器モデルや最先端のマルチタスクCNNよりも優れた性能を示し、未観測ドメインへの一般化能力も優れている。
We propose an end-to-end Multitask Learning Transformer framework, named MulT, to simultaneously learn multiple high-level vision tasks, including depth estimation, semantic segmentation, reshading, surface normal estimation, 2D keypoint detection, and edge detection. Based on the Swin transformer model, our framework encodes the input image into a shared representation and makes predictions for each vision task using task-specific transformer-based decoder heads. At the heart of our approach is a shared attention mechanism modeling the dependencies across the tasks. We evaluate our model on several multitask benchmarks, showing that our MulT framework outperforms both the state-of-the art multitask convolutional neural network models and all the respective single task transformer models. Our experiments further highlight the benefits of sharing attention across all the tasks, and demonstrate that our MulT model is robust and generalizes well to new domains. Our project website is at https://ivrl.github.io/MulT/.
研究の動機と目的
- 多様な高レベルビジョンタスクを対象とする変換器を用いたエンドツーエンドのマルチタスク学習フレームワークの開発。
- 2次元、3次元、セマンティックビジョンタスクの間でタスク依存関係を明示的にモデル化するため、共有された注目メカニズムを用いる。
- 単一タスクモデルや既存のマルチタスクCNNベースラインと比較して、性能と一般化能力の向上。
- 新しい分布外ドメインに対するフレームワークのロバストネスと適応性の評価。
- タスク固有のデコーダー間で共有される注目メカニズムが、特徴学習とモデル一般化を向上させることの実証。
提案手法
- モデルは入力画像から共有された潜在表現を抽出するためにSwin変換器エンコーダーを用いる。
- 各ビジョンタスクは、共有エンコーダー特徴に注目するタスク固有の変換器デコーダーヘッドを介して予測される。
- 異なるタスクのデコーダー間で共有されたクロス注目メカニズムが導入され、タスク間の特徴通信が可能になる。
- 全タスクの損失を組み合わせた重み付きマルチタスク損失関数を用いて、モデル全体をエンドツーエンドで訓練する。
- 単一のコンactモデルを用いて、複数のタスクの共同学習と推論をサポートする。
- ドメイン一般化の評価は、ぼやけたTaskonomy画像やCocoDoomデータセットなどの分布外データでのファインチューニングを用いて行う。
実験結果
リサーチクエスチョン
- RQ1変換器ベースのモデルは、単一タスクモデルと比較して、複数の高レベルビジョンタスクを共同で学習し、性能を向上させることができるか?
- RQ2共有注目メカニズムによるタスク間依存関係の明示的モデリングは、全タスクの性能向上に寄与するか?
- RQ3提案されたマルチタスク変換器は、既存のマルチタスクCNNベースラインと比較して、未観測ドメインへの一般化能力が優れているか?
- RQ4共有注目メカニズムは、マルチタスクビジョン学習における性能とパラメータ効率にどのように影響するか?
- RQ52次元、3次元、セマンティック理解を含む多様なタスクにおいて、モデルは強力な性能を維持できるか?
主な発見
- MulTは、Taskonomy、Replica、NYU、CocoDoomを含む標準ベンチマークにおいて、すべての単一タスクSwin変換器モデルおよび最先端のマルチタスクCNNベースライン(Taskgrouping [42])を上回る性能を示した。
- ドメインシフト(ガウスノイズ)を伴うTaskonomyデータセットでは、表面法線推定においてファインチューニングありで12.6%の誤差、ファインチューニングなしで27.0%の誤差を達成し、Cross-task [54](17.4%および46.2%)およびTaskgrouping [42](21.9%および55.1%)を顕著に上回った。
- CocoDoomデータセットでは、再照明タスクにおいてファインチューニングありで13.3%の誤差、ファインチューニングなしで39.3%の誤差を達成し、Cross-task [54](18.5%および54.3%)およびTaskgrouping [42](25.3%および67.7%)を上回った。
- アブレーションスタディの結果、共有注目が特にデータが少ないまたは分布外の設定において、性能向上に顕著に寄与することが確認された。
- MulTは、既存のマルチタスクモデルと比較して、ファインチューニングなしでも新しいドメインへの一般化能力が優れており、ロバストネスとドメイン適応能力を示した。
- 単一の共有エンコーダーとタスク固有のデコーダーを用いて、6つの多様なビジョンタスクで高い性能を維持し、個々のモデルを訓練するのと比較して計算コストを削減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。