[論文レビュー] TORE: Token Reduction for Efficient Human Mesh Recovery with Transformer
TOREは、骨格幾何学的事前知識と学習可能なクラスタリングを活用して、冗長な2D画像特徴量と3Dメッシュ頂点を削減する、効率的なTransformerベースの人体メッシュ回復のためのトークン削減フレームワークを提案する。階層的な幾何学的注意機構と非教師付き特徴クラスタリングによりトークンを低減することで、Human3.6Mおよび3DPWベンチマークでSOTAの精度を達成し、最大78%のFLOPs低減と2.5倍の高速化を実現し、効率性と精度のトレードオフが優れていることを示した。
In this paper, we introduce a set of simple yet effective TOken REduction (TORE) strategies for Transformer-based Human Mesh Recovery from monocular images. Current SOTA performance is achieved by Transformer-based structures. However, they suffer from high model complexity and computation cost caused by redundant tokens. We propose token reduction strategies based on two important aspects, i.e., the 3D geometry structure and 2D image feature, where we hierarchically recover the mesh geometry with priors from body structure and conduct token clustering to pass fewer but more discriminative image feature tokens to the Transformer. Our method massively reduces the number of tokens involved in high-complexity interactions in the Transformer. This leads to a significantly reduced computational cost while still achieving competitive or even higher accuracy in shape recovery. Extensive experiments across a wide range of benchmarks validate the superior effectiveness of the proposed method. We further demonstrate the generalizability of our method on hand mesh recovery. Visit our project page at https://frank-zy-dou.github.io/projects/Tore/index.html.
研究の動機と目的
- 入力特徴量とメッシュ頂点に含まれる冗長なトークンが引き起こす、Transformerベースの人体メッシュ回復(HMR)における高い計算コストを解消すること。
- 人体の身体幾何学的構造的事前知識と特徴的な画像特徴を活用することで、精度を損なわず効率性を向上させること。
- 非情報的トークンを削除しつつ幾何学的忠実性を保持する、軽量でエンドツーエンド微分可能なトークン削減メカニズムを構築すること。
- 手部メッシュ回復への一般化性と、部分的遮蔽や困難な視点下でのロバスト性を示すこと。
- 単眼HMRにおける精度と推論速度のパレート最適なバランスを達成すること。
提案手法
- 全メッシュ頂点を階層的に回帰するための小さな骨格レベルのボディトークンを用いるニューラルシェイプレグレッサー(NSR)を導入し、頂点同士のアテンション計算の複雑さを低減する。
- クラスタリングに基づく選択を用いてCNN特徴パッチをクラスタリングする、学習可能で非教師付きのトークンプルーナーを提案し、判別的な画像トークンのみを保持する。
- アテンション行列の分解を用いて、階層的なメッシュ回復を構造的アテンションメカニズムとして解釈し、骨格事前知識を活用して特徴相互作用をガイドする。
- 追加のアノテーションを必要とせず、1パスのエンドツーエンド学習スキームを採用することで、プルーニングとメッシュ回帰の共同最適化を可能にする。
- 精度と効率のバランスを最適化するために、20%のプルーニングレートを経験的に選定し、複数のベンチマークで検証した。
- FastMETROおよびMETROスタイルのアーキテクチャにトークン削減モジュールを統合し、プラグアンドプレイ式の効率性向上を実現した。
実験結果
リサーチクエスチョン
- RQ12D画像特徴量と3Dメッシュ頂点の両方における冗長トークンの削減が、精度を損なわずTransformerベースのHMRにおける計算コストを顕著に低減できるか?
- RQ2骨格関節の事前知識を用いて、アテンション機構における全メッシュ頂点クエリを置き換えることで、幾何学的注意のメッシュ回復がどの程度有効か?
- RQ3非教師付きでクラスタリングに基づくトークンプルーナーは、意味的に意味のある画像特徴を特定し、一般化性を向上させるとともにFLOPsを低減できるか?
- RQ4提案手法のトークン削減戦略は、部分的遮蔽や困難な単眼視点下でも性能を維持または向上できるか?
- RQ5この手法は、手部メッシュ再構築などの他のメッシュ回復タスクへどの程度一般化できるか?
主な発見
- TOREは、Human3.6Mおよび3DPWベンチマークでベースライン手法と比較して最大78%のFLOPs低減を達成しながら、精度を維持または向上させた。
- Human3.6Mでは、PAMPJPEが36.4 mm、スループットが249.2 FPSを達成し、速度と精度の両面でTCFormerおよびPPTを上回った。
- FastMETRO-Eb0では、1.6 GFLOPのモデルサイズで870.4 FPSのスループットを達成し、スループットとPAMPJPEの両面でPPTを上回った。
- 自己アテンションの可視化から、関節と頂点が非局所的でロバストな相互作用を学習していることが確認され、遮蔽や部分観測下でも性能が向上した。
- 20%のプルーニングレートが最適なトレードオフをもたらし、PAMPJPEが43.9 mmを記録したが、より高いレート(例:75%)ではFLOPsは低減したものの性能が劣化した。
- 3DPWおよびHuman3.6Mにおける定性的な結果から、TOREはMETRO、MeshGraphormer、FastMETROよりも正確で安定したメッシュを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。