Skip to main content
QUICK REVIEW

[論文レビュー] DeMT: Deformable Mixer Transformer for Multi-Task Learning of Dense Prediction

Yangyang Xu, Yibo Yang|arXiv (Cornell University)|Jan 9, 2023
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

DeMTは、変形可能畳み込みニューラルネットワークとクエリベースのトランスフォーマーを組み合わせた新しいハイブリッドアーキテクチャを提案する。このアーキテクチャは、タスククエリとしての変形特徴を活用することでタスクに適した特徴を強化し、計算量を削減する。NYUD-v2およびPASCAL-Contextの両ベンチマークで最先端の性能を達成し、競合モデルよりも少ないGFLOPsで実行される。

ABSTRACT

Convolution neural networks (CNNs) and Transformers have their own advantages and both have been widely used for dense prediction in multi-task learning (MTL). Most of the current studies on MTL solely rely on CNN or Transformer. In this work, we present a novel MTL model by combining both merits of deformable CNN and query-based Transformer for multi-task learning of dense prediction. Our method, named DeMT, is based on a simple and effective encoder-decoder architecture (i.e., deformable mixer encoder and task-aware transformer decoder). First, the deformable mixer encoder contains two types of operators: the channel-aware mixing operator leveraged to allow communication among different channels ($i.e.,$ efficient channel location mixing), and the spatial-aware deformable operator with deformable convolution applied to efficiently sample more informative spatial locations (i.e., deformed features). Second, the task-aware transformer decoder consists of the task interaction block and task query block. The former is applied to capture task interaction features via self-attention. The latter leverages the deformed features and task-interacted features to generate the corresponding task-specific feature through a query-based Transformer for corresponding task predictions. Extensive experiments on two dense image prediction datasets, NYUD-v2 and PASCAL-Context, demonstrate that our model uses fewer GFLOPs and significantly outperforms current Transformer- and CNN-based competitive models on a variety of metrics. The code are available at https://github.com/yangyangxu0/DeMT .

研究の動機と目的

  • CNNベースのモデルが有するグローバルモデリングの限界とクロスタスク相互作用の不足、およびトランスフォーマーベースのモデルが有するタスクに特化した特徴の分離性と計算コストの問題を解決すること。
  • 変形可能CNNの局所的インダクティブバイアスとトランスフォーマーのグローバルモデリング能力を効果的に統合する包括的なフレームワークを構築すること。
  • 変形特徴をクエリとして用いるクエリベースのアテンション機構を導入することで、多タスク密度予測における効率的でタスクに適した特徴学習を可能にすること。
  • 複数の密度予測タスク(セマンティックセグメンテーション、深度推定、サルイエンシー予測など)において、性能を維持または向上させつつ計算オーバーヘッドを低減すること。

提案手法

  • DeMTモデルは、チャネルに適応したミキシングと空間に適応した変形可能畳み込みを適用する変形可能ミキサー・エンコーダーを用い、タスク固有の変形特徴を生成する。
  • タスクに適したトランスフォーマー・デコーダーは、融合特徴からのクロスタスク依存性をモデル化するためのマルチヘッド自己アテンションを用いたタスク相互作用ブロックを備える。
  • タスククエリブロックは、変形特徴をクエリとし、タスク相互作用特徴をキー/バリューとして用い、クエリベースのアテンションによりタスク固有の出力特徴を生成する。
  • バックボーンから得られるマルチスケール特徴を統合し、シンプルで軽量な設計を採用することで効率性を維持する。
  • セマンティックセグメンテーション、深度推定、サルイエンシー予測を含む複数の密度予測タスク上で、エンドツーエンドでモデルを学習する。
  • アブレーションスタディにより、変形可能ミキサー、タスク相互作用、タスククエリブロックの各コンponentの必要性が検証される。

実験結果

リサーチクエスチョン

  • RQ1変形可能CNNとクエリベースのトランスフォーマーを組み合わせることで、計算コストを低減しつつ多タスク密度予測の性能を向上させることができるか?
  • RQ2トランスフォーマー・デコーダーにおいて変形特徴をクエリとして用いることで、タスクに適した特徴学習がどのように向上するか?
  • RQ3タスク相互作用ブロックやマルチスケール特徴統合といったアーキテクチャ的要素がモデル性能に与える影響は何か?
  • RQ4精度と効率性の観点から、DeMTは最先端のCNNおよびトランスフォーマー基盤のMTLモデルと比較してどのように差をつけるか?

主な発見

  • DeMTは、セマンティックセグメンテーション、深度推定、ヒューマンパーツセグメンテーションを含む、NYUD-v2およびPASCAL-Contextの複数の密度予測タスクで最先端の性能を達成した。
  • Swin-Bバックボーンを用いることで、NYUD-v2のすべての指標で最高性能を記録し、優れた汎化性能とスケーラビリティを示した。
  • 競合するトランスフォーマーおよびCNNベースのモデルよりも少ないGFLOPsで実行しながら、すべての評価指標で優れた性能を示した。
  • アブレーションスタディにより、タスク相互作用ブロックが性能向上において最も重要であることが確認され、変形可能ミキサーの深さd=4が最適であるが、効率性を考慮してd=1が採用された。
  • 4スケールの特徴を用いることで性能が顕著に向上したため、マルチスケール表現学習の重要性が示された。
  • 定性的な結果では、SemSegおよびヒューマンパーツタスクにおいて、SwinベースラインおよびATRCモデルと比較してDeMTがより高品質で正確な予測を生成していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。