Skip to main content
QUICK REVIEW

[論文レビュー] Video-based Human-Object Interaction Detection from Tubelet Tokens

Danyang Tu, Wei Sun|arXiv (Cornell University)|Jun 4, 2022
Human Pose and Action Recognition被引用数 8
ひとこと要約

本論文では、ビデオベースの人体・物体インタラクション(V-HOI)検出を目的とした視覚Transformer、TUTORを提案する。TUTORは、空間的・時間的領域にわたり選択的注意と凝集処理を用いて学習されるチューブレットトークンを用い、コンパクトで表現力のある時空間的表現を生成する。本手法はVidHOIで相対的に16.14%のmAP向上を達成し、先行手法と比較して4倍の高速化を実現し、優れた精度と効率性を示した。

ABSTRACT

We present a novel vision Transformer, named TUTOR, which is able to learn tubelet tokens, served as highly-abstracted spatiotemporal representations, for video-based human-object interaction (V-HOI) detection. The tubelet tokens structurize videos by agglomerating and linking semantically-related patch tokens along spatial and temporal domains, which enjoy two benefits: 1) Compactness: each tubelet token is learned by a selective attention mechanism to reduce redundant spatial dependencies from others; 2) Expressiveness: each tubelet token is enabled to align with a semantic instance, i.e., an object or a human, across frames, thanks to agglomeration and linking. The effectiveness and efficiency of TUTOR are verified by extensive experiments. Results shows our method outperforms existing works by large margins, with a relative mAP gain of $16.14\%$ on VidHOI and a 2 points gain on CAD-120 as well as a $4 imes$ speedup.

研究の動機と目的

  • パッチベースのトークン化手法が、インスタンスレベルの意味を捉えられず、冗長性とスパarsityに苦しむビデオベースのHOI検出における限界を是正すること。
  • エンドツーエンドのトークン抽象化とリンク処理を通じて、ビデオから高次元に抽象化され、インスタンスに整合した表現を学習する時空間的Transformerの開発。
  • ビデオをコンパクトで表現力のあるチューブレットトークンに構造化することで、V-HOI検出における精度と推論効率の両方を向上させること。
  • 従来の手法と比較して、長距離依存関係や時間的関連性をより良くモデル化できること。

提案手法

  • TUTORは二段階のトークン化プロセスを採用する。まず、選択的注意により空間的領域で意味的に関連するパッチトークンを特定し、次にそれらをインスタンスレベルのトークンに凝集することで冗長性を低減する。
  • トークンの凝集は、固定サイズのプーリングを避けるために、意味的に類似したトークンを効果的に統合する学習可能な不規則な窓演算によって実施される。
  • 時間的リンクにより、複数フレームに跨るインスタンストークンを接続し、動的かつ時間的に整合したチューブレットトークンを形成する。
  • 空間的および時間的位置符号化を別々に統合する——空間的凝集には2次元、時間的リンクには1次元の位置符号化を用いることで、時空間的ダイナミクスをより良くモデル化する。
  • 学習可能なプロジェクションヘッドにより、凝集されたトークンの次元を拡張し、特徴の豊かさと性能を向上させる。
  • フレームワークはエンドツーエンドで学習可能であり、トークン生成とインタラクション予測の両方を同時に最適化可能である。

実験結果

リサーチクエスチョン

  • RQ1学習可能で適応的なトークン化戦略は、パッチベースの固定トークン化を上回る性能を発揮できるか?
  • RQ2空間的領域における選択的注意と凝集処理は、ビデオ特徴の表現のコンパクトさを向上させ、冗長性を低減できるか?
  • RQ3フレーム間のインスタンストークンの時間的リンクは、動的かつ時間的に変化する人体・物体インタラクションに適応できるか?
  • RQ4提案されたチューブレットトークン化は、SOTA手法と比較してmAPと推論速度の両面で顕著な向上をもたらすか?

主な発見

  • TUTORは、先行SOTA手法と比較してVidHOIデータセットで相対的に16.14%のmAP向上を達成した。
  • CAD-120データセットではF1スコアが2ポイント向上し、小規模なベンチマークでも優れた一般化性能を示した。
  • TUTORは、既存のTransformerベースのV-HOI手法と比較して推論時間で4倍の高速化を達成し、高い効率性を示した。
  • アブレーションスタディの結果、凝集されたトークンの次元を増加させることでmAPが6%以上向上し、特徴の豊かさの重要性が裏付けられた。
  • k-meansクラスタリングを学習可能な凝集処理に置き換えることで、性能が顕著に向上した。これはエンドツーエンド最適化の利点を示している。
  • 空間モジュールと時間モジュールにそれぞれ別々の2次元および1次元位置符号化を用いることで、標準的な3次元符号化よりも優れた性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。