Skip to main content
QUICK REVIEW

[論文レビュー] PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data

Roei Herzig, Ofir Abramovich|arXiv (Cornell University)|Dec 8, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

PromptonomyViT は、合成シーンデータを活用して現実世界の動画理解を向上させる、動画変換器向けのマルチタスクプロンプト学習フレームワークを提案する。深度、セグメンテーション、ノーマル推定などの補助的シーンレベルタスクのためのタスク固有のプロンプトを導入することで、合成タスク間の共有された時空間的構造を捉え、ドメイン適応を一切行わずに下流の行動認識性能を向上させ、複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Action recognition models have achieved impressive results by incorporating scene-level annotations, such as objects, their relations, 3D structure, and more. However, obtaining annotations of scene structure for videos requires a significant amount of effort to gather and annotate, making these methods expensive to train. In contrast, synthetic datasets generated by graphics engines provide powerful alternatives for generating scene-level annotations across multiple tasks. In this work, we propose an approach to leverage synthetic scene data for improving video understanding. We present a multi-task prompt learning approach for video transformers, where a shared video transformer backbone is enhanced by a small set of specialized parameters for each task. Specifically, we add a set of "task prompts", each corresponding to a different task, and let each prompt predict task-related annotations. This design allows the model to capture information shared among synthetic scene tasks as well as information shared between synthetic scene tasks and a real video downstream task throughout the entire network. We refer to this approach as "Promptonomy", since the prompts model task-related structure. We propose the PromptonomyViT model (PViT), a video transformer that incorporates various types of scene-level information from synthetic data using the "Promptonomy" approach. PViT shows strong performance improvements on multiple video understanding tasks and datasets. Project page: \url{https://ofir1080.github.io/PromptonomyViT}

研究の動機と目的

  • 深度、セグメンテーション、3次元構造などの複雑なシーンレベルラベルを含む実動画データセットのアノテーションにかかる高コストを軽減すること。
  • 豊富なシーンアノテーションを備えた合成データが、現実世界のタスクにおける動画理解モデルの性能向上に有効であるかどうかを検証すること。
  • 複数の合成シーンタスクと実際の下流の行動認識タスクを同時に学習できる統合フレームワークを構築すること。
  • タスク固有のプロンプトを統合することで、ネットワーク全体にわたり情報伝達を促進し、ドメインギャップの問題を最小限に抑えること。
  • プロンプトベースのマルチタスク学習が、リソースが限られた環境において、標準的なファインチューニングやドメイン適応手法を上回ることを実証すること。

提案手法

  • 各補助的シーンレベルタスクごとに、タスク固有の学習可能なプロンプトを入力層に挿入する、共通のビジョン変換器(ViT)バックボーンを動画クリップの処理に用いる。
  • 各タスクプロンプトは、動画トークンに注目し、深度マップ、セマンティックセグメンテーション、またはノーマルベクトルなどのタスク固有の出力を予測する、小さな学習可能なパラメータの集合である。
  • 異なる種類のシーンレベルの監視情報を提供する多様なソース(例:PHAV、HyperSim、KIST SynADL、EHOI)からの合成データを用いて、エンドツーエンドでプロンプトを訓練する。
  • 行動認識ヘッドは、CLSトークンを用いて実データ上で訓練される一方、タスクプロンプトはそれぞれの合成ラベルによって監視され、知識の転送が可能になる。
  • このアーキテクチャにより、初期層からタスク間の情報フローが可能となり、合成タスク間で共有された表現が生まれ、実際の下流タスクに恩恵をもたらす。
  • この手法は、「プロンプトニクス(Promptonomy)」と名付けられ、タスク間の構造を管理し、統一された変換器フレームワーク内でマルチタスク学習を可能にする設計を反映している。

実験結果

リサーチクエスチョン

  • RQ1複数種類のアノテーションが付加された合成シーンデータは、現実世界の行動認識タスクにおける動画理解モデルの性能向上に寄与するか?
  • RQ2ドメインギャップを低減する観点から、マルチタスクプロンプト学習は、標準的なファインチューニングやドメイン適応と比較して、合成データと実データの間のギャップをどれほど効果的に縮小できるか?
  • RQ3タスク固有のプロンプトが、異なる合成シーンレベルタスク間で共有される表現をどれほど効果的に捉え、実際の下流タスクに転送できるか?
  • RQ4深度、セグメンテーション、ノーマルなどの複数の補助タスクを含めることで、単一タスクの事前学習に比べて一般化性能が向上するか?
  • RQ5タスク固有のヘッドやドメイン適応モジュールを必要とせずに、統合されたプロンプトベースアーキテクチャが、多様なシーンレベルタスクを効果的に管理できるか?

主な発見

  • PromptonomyViT は、Something-Something V2、Diving48、Ego4D、AVA の各ベンチマークで最先端の性能を達成し、標準的なファインチューニングやドメイン適応ベースラインを上回った。
  • ドメイン適応を明示的に行わずに、マルチタスクプロンプトを用いた合成データでの事前学習により、行動認識タスクで顕著な精度向上が得られた。
  • 定性的な結果から、トレーニング中に実際のラベルを一度も見ないにもかかわらず、タスクプロンプトが実動画フレームに対して意味的で整合性のある予測(例:深度、セグメンテーション、手と物体のボックス)を生成することが示された。
  • アブレーションスタディにより、専用のプロンプトを備えた複数の合成タスクを用いることで、1つまたは2つのタスクのみを用いる場合よりも高い性能が得られることを確認した。
  • マルチタスクプロンプトによる共有インダクティブバイアスのおかげで、エゴセントリック、マルチビュー、人間と物体の相互作用を含む多様な動画ドメインにわたって、優れた一般化性能を示した。
  • タスクプロンプトの使用により、合成データから実データへの有効な知識転送が可能となり、データ量が限られた状況でも性能向上が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。