Skip to main content
QUICK REVIEW

[論文レビュー] Effective Adaptation in Multi-Task Co-Training for Unified Autonomous Driving

Xiwen Liang, Yangxin Wu|arXiv (Cornell University)|Sep 19, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

本論文は、学習可能なマルチスケールアダプタを介して市販の自己教師ありモデルを適応させるpretrain-adapt-finetuneパラダイムを提案し、セマンティックセグメンテーション、ドリivableエリアセグメンテーション、オブジェクト検出の各タスクにおいて、性能を顕著に向上させることで、自動運転におけるマルチタスク学習を改善する。さらに、タスク固有のプロンプトを通じてCLIPの視覚言語的バイアスを統合するLV-Adapterを導入し、最小限のトレーニングオーバーヘッドで最先端の結果を達成する。

ABSTRACT

Aiming towards a holistic understanding of multiple downstream tasks simultaneously, there is a need for extracting features with better transferability. Though many latest self-supervised pre-training methods have achieved impressive performance on various vision tasks under the prevailing pretrain-finetune paradigm, their generalization capacity to multi-task learning scenarios is yet to be explored. In this paper, we extensively investigate the transfer performance of various types of self-supervised methods, e.g., MoCo and SimCLR, on three downstream tasks, including semantic segmentation, drivable area segmentation, and traffic object detection, on the large-scale driving dataset BDD100K. We surprisingly find that their performances are sub-optimal or even lag far behind the single-task baseline, which may be due to the distinctions of training objectives and architectural design lied in the pretrain-finetune paradigm. To overcome this dilemma as well as avoid redesigning the resource-intensive pre-training stage, we propose a simple yet effective pretrain-adapt-finetune paradigm for general multi-task training, where the off-the-shelf pretrained models can be effectively adapted without increasing the training overhead. During the adapt stage, we utilize learnable multi-scale adapters to dynamically adjust the pretrained model weights supervised by multi-task objectives while leaving the pretrained knowledge untouched. Furthermore, we regard the vision-language pre-training model CLIP as a strong complement to the pretrain-adapt-finetune paradigm and propose a novel adapter named LV-Adapter, which incorporates language priors in the multi-task model via task-specific prompting and alignment between visual and textual features.

研究の動機と目的

  • 自己教師あり事前学習手法がマルチタスク自動運転シナリオにおいて転移性が低い理由を調査すること。
  • 事前学習と微調整の目的の不整合が原因で生じるマルチタスク学習における性能低下を是正すること。
  • 再トレーニングや計算コストの増加なしに事前学習モデルを効率的に適応する手法を開発すること。
  • 学習可能なプロンプトを介してCLIPの視覚言語的事前学習知識を視覚特徴に統合し、下流タスクの性能を向上させること。
  • 適応段階が事前学習とマルチタスク微調整の間のギャップを埋める上で重要であることを示すこと。

提案手法

  • 事前学習モデルを微調整の前に、学習可能なマルチスケールアダプタを介して適応させるpretrain-adapt-finetuneパラダイムを導入し、元の重みを保持する。
  • タスク固有の学習可能なプロンプトを用いて、CLIPの言語バイアスを視覚特徴に統合するLV-Adapterを設計する。
  • 適応段階で視覚的・言語的特徴をアライメントさせ、タスク間での特徴一般化を向上させる。
  • アダプタモジュールにおける特徴連結後に、チャネル次元を低減するために1×1畳み込み層を用いる。
  • 連続的プロンプトチューニングを採用し、タスク固有のテキスト埋め込みを学習して視覚特徴の適応をガイドする。
  • 適応エポック数を1に固定し、微調整エポック数を35に固定することで、最適な効率性と性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1最先端の自己教師あり事前学習手法が、なぜマルチタスク自動運転シナリオで性能を発揮しないのか?
  • RQ2軽量な適応段階が、pretrain-finetuneパラダイムにおける目的の不整合によって引き起こされる性能低下を緩和できるか?
  • RQ3CLIPのような視覚言語事前学習モデルは、自動運転におけるマルチタスク特徴学習をどのように向上させられるか?
  • RQ4効率的なマルチタスク転送を実現するための適応および微調整エポック数の最適な設定は何か?
  • RQ5学習可能なプロンプトを介して言語バイアスを統合することで、より一般化可能な視覚表現が得られるか?

主な発見

  • pretrain-adapt-finetuneパラダイムは、セマンティックセグメンテーション、ドリivableエリアセグメンテーション、オブジェクト検出の3つのタスクすべてにおいて、標準的なpretrain-finetuneベースラインと比較して顕著に性能を向上させる。
  • LV-Adapterはセマンティックセグメンテーションで62.2 mIoU、ドリivableエリアセグメンテーションで83.7 mIoUを達成し、単一タスクベースラインおよび自己学習ベースラインを上回る。
  • 1エポックの適応と35エポックの微調整で最良の性能が得られ、最小限の適応で効果的な知識転送が可能であることが示された。
  • アブレーションスタディにより、LV-Adapterが学習可能なプロンプトを介して言語知識を直接統合する方法が、プロンプトやV2L適応モジュールよりも効果的であることが確認された。
  • 本手法は、事前学習とマルチタスク微調整の間の性能ギャップを縮小し、適応段階が事前学習モデルのマルチタスク設定における潜在的性能を解き放つ鍵であることを示した。
  • CLIPのテキストエンコーダーを用いて視覚特徴学習をガイドすることで、多様な下流タスクに有益な一般化可能なインダクティブバイアスが得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。