Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Temporal Contexts with Strided Transformer for 3D Human Pose Estimation

Wenhao Li, Hong Liu|arXiv (Cornell University)|Mar 26, 2021
Human Pose and Action Recognition参考文献 55被引用数 16
ひとこと要約

本稿では、長時間の2次元ポーズシーケンスからグローバルおよびローカルの時間的コンテキストを階層的に統合するために、フィードフォワードネットワークにストライド付き畳み込みを活用する、新しいTransformerベースのアーキテクチャ「Strided Transformer」を提案する。計算量を顕著に削減しながら、3次元ポーズ推定の精度を向上させる。本手法は、完全なシーケンスから単一フレームへの監視スキームを採用することで、少ないパラメータ数でHuman3.6MおよびHumanEva-Iで最先端の性能を達成し、時間的滑らかさが向上する。

ABSTRACT

Despite the great progress in 3D human pose estimation from videos, it is still an open problem to take full advantage of a redundant 2D pose sequence to learn representative representations for generating one 3D pose. To this end, we propose an improved Transformer-based architecture, called Strided Transformer, which simply and effectively lifts a long sequence of 2D joint locations to a single 3D pose. Specifically, a Vanilla Transformer Encoder (VTE) is adopted to model long-range dependencies of 2D pose sequences. To reduce the redundancy of the sequence, fully-connected layers in the feed-forward network of VTE are replaced with strided convolutions to progressively shrink the sequence length and aggregate information from local contexts. The modified VTE is termed as Strided Transformer Encoder (STE), which is built upon the outputs of VTE. STE not only effectively aggregates long-range information to a single-vector representation in a hierarchical global and local fashion, but also significantly reduces the computation cost. Furthermore, a full-to-single supervision scheme is designed at both full sequence and single target frame scales applied to the outputs of VTE and STE, respectively. This scheme imposes extra temporal smoothness constraints in conjunction with the single target frame supervision and hence helps produce smoother and more accurate 3D poses. The proposed Strided Transformer is evaluated on two challenging benchmark datasets, Human3.6M and HumanEva-I, and achieves state-of-the-art results with fewer parameters. Code and models are available at \url{https://github.com/Vegetebird/StridedTransformer-Pose3D}.

研究の動機と目的

  • 長時間の2次元ポーズシーケンスにおける長距離時間的依存関係を効率的にモデル化する課題に対処すること。
  • 長時間の動画シーケンスを処理する際、標準的なTransformerの2次関数的計算コストを低減すること。
  • プーリングによる情報損失を避けるために、逐次的にシーケンス長を短縮しながら、細粒度の局所特徴を保持すること。
  • 完全なシーケンスと単一のターゲットフレームの両レベルでの監視を導入することで、推定精度と時間的滑らかさを向上させること。

提案手法

  • ヴァニラTransformerエンコーダー(VTE)のフィードフォワードネットワーク(FFN)における全結合層をストライド付き畳み込みに置き換え、逐次的にシーケンス長を短縮し、局所的およびグローバルなコンテキストを統合すること。
  • VTEの出力を処理して2次元ポーズシーケンスのコンactで階層的な表現を生成する、ストライド付きTransformerエンコーダー(STE)を導入すること。
  • 完全なシーケンスと単一のターゲットフレームの両レベルで監視を適用する、完全から単一への監視スキームを設計すること。
  • VTEではマルチヘッド自己注意機構を用いて、全フレームにわたる長距離依存関係をモデル化する一方、STEではストライド付き畳み込みが局所的パターンの統合に特化する。
  • シーケンスレベルとフレームレベルの損失を組み合わせて、エンドツーエンドでモデルを訓練することで、耐障害性と精度を向上させること。
  • VTEとSTEを同時に最適化する2段階の訓練戦略を採用し、補完的な表現を学習すること。

実験結果

リサーチクエスチョン

  • RQ1Transformerのフィードフォワードネットワークにストライド付き畳み込みを適用することで、3次元ポーズ推定に必要な重要な時間的情報を保持したまま、シーケンス長を効果的に短縮できるか?
  • RQ2ストライド付きTransformerにおける階層的グローバルおよびローカル特徴統合は、標準的なTransformerと比較して、3次元ポーズ推定精度をどのように向上させるか?
  • RQ3完全から単一への監視スキームは、予測された3次元ポーズの時間的滑らかさと表現品質をどの程度向上させるか?
  • RQ4提案手法は、従来のTransformerベースの手法と比較して、少ないパラメータ数と低い計算コストで最先端の性能を達成できるか?

主な発見

  • 提案されたStrided Transformerは、Human3.6MおよびHumanEva-Iで最先端の性能を達成し、Human3.6Mでは平均MPJPEが40.2 mm、HumanEva-Iでは47.6 mmを記録した。
  • FFNをストライド付き畳み込みに置き換えることで、計算コストを顕著に削減しながら、標準的なTransformerと同等またはそれ以上の精度を維持した。
  • 完全から単一への監視スキームは、プーリングベースのベースラインと比較してMPJPEを0.4 mm低減した。これは、時間的滑らかさの向上に有効であることを示している。
  • VTEモジュールを削除するとMPJPEが1.1 mm上昇し、長距離依存関係のモデル化においてその重要性が示された。
  • STEモジュールを削除するとMPJPEが47.6 mmに上昇し、階層的ローカルおよびグローバル特徴統合の重要性が確認された。
  • 定性的な結果から、本モデルは高速な動きや部分的遮蔽があるような困難な屋外動画に対しても、現実的で構造的に妥当な3次元ポーズを生成することが可能であることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。