Skip to main content
QUICK REVIEW

[論文レビュー] Spectral Graphormer: Spectral Graph-based Transformer for Egocentric Two-Hand Reconstruction using Multi-View Color Images

Tze Ho Elden Tse, Franziska Mueller|arXiv (Cornell University)|Aug 21, 2023
Medical Imaging and Analysis被引用数 6
ひとこと要約

本稿では、スペクトルグラフ畳み込みとソフトアテンションを用いたマルチビュー特徴統合を活用し、高精細で物理的に妥当なメッシュを生成する、マルチビューRGB画像からの二本の手の再構築を目的とした新規なトランスフォーマー基盤フレームワーク、Spectral Graphormerを提案する。本手法は、拡張された前腕を含むリアルなメッシュを再構築でき、合成データおよび実データにおいて最先端の性能を達成し、AR/VRアプリケーションにおける強力な汎化性能とリアルタイム処理の可能性を示している。

ABSTRACT

We propose a novel transformer-based framework that reconstructs two high fidelity hands from multi-view RGB images. Unlike existing hand pose estimation methods, where one typically trains a deep network to regress hand model parameters from single RGB image, we consider a more challenging problem setting where we directly regress the absolute root poses of two-hands with extended forearm at high resolution from egocentric view. As existing datasets are either infeasible for egocentric viewpoints or lack background variations, we create a large-scale synthetic dataset with diverse scenarios and collect a real dataset from multi-calibrated camera setup to verify our proposed multi-view image feature fusion strategy. To make the reconstruction physically plausible, we propose two strategies: (i) a coarse-to-fine spectral graph convolution decoder to smoothen the meshes during upsampling and (ii) an optimisation-based refinement stage at inference to prevent self-penetrations. Through extensive quantitative and qualitative evaluations, we show that our framework is able to produce realistic two-hand reconstructions and demonstrate the generalisation of synthetic-trained models to real data, as well as real-time AR/VR applications.

研究の動機と目的

  • エゴセントリックでマルチビューの二本の手再構築、特に拡張された前腕を含む適切なデータセットの不足に対処すること。
  • ルートジョイントのアライメントに依存せず、マルチビューRGB画像から二本の手の絶対的ルートポーズを直接回帰する深層学習フレームワークの開発。
  • スペクトルグラフベースのデコーディングと最適化に基づくリファインメントにより、メッシュのリアリズムと物理的妥当性を向上させること。
  • 大規模な合成データセットと実際のマルチカメラキャプチャを用いて、合成データから実世界データへの有効な汎化を実現すること。
  • 効率的なトークン設計とパラメータ圧縮により、モデルの複雑さと計算コストを低減すること。

提案手法

  • 領域固有の特徴を生成するために、ソフトアテンションに基づくマルチビュー画像特徴統合戦略を提案し、空間情報を保持したままモデルサイズを35%削減した。
  • フレームワークは、スペクトルグラフ理論からのグラフラプラシアンの性質をトランスフォーマーエンコーダーおよびデコーダーに統合したスペクトルグラフベースのトランスフォーマーアーキテクチャを採用している。
  • 粗いから細かい段階へのスペクトルグラフ畳み込みデコーダーを用いて、アップサンプリング時のメッシュ平滑化を実現し、メッシュ品質と詳細の保持を向上させた。
  • 推論段階で最適化に基づくリファインメントステージを適用し、自己貫通の防止と再構築メッシュの物理的妥当性の向上を図った。
  • モデルの事前学習のため、多様なエゴセントリックビュー、照明、背景を備えた大規模な合成データセットを構築し、評価には実際のマルチカメラデータセットを収集した。
  • トランスフォーマーエンコーダーにおける頂点クエリ数($V'$)を段階的に削減することでモデル圧縮を達成し、計算コストの低減を最優先するため、$V'$の削減を$C$の削減よりも優先した。

実験結果

リサーチクエスチョン

  • RQ1エゴセントリックな設定下で、マルチビューRGB画像から高解像度の二本の手メッシュ(拡張された前腕を含む)を効果的に再構築できるトランスフォーマー基盤アーキテクチャは存在するか?
  • RQ2ソフトアテンションに基づくマルチビュー特徴統合は、従来の連結やプーリング手法と比較して、性能とモデル効率の面でどのように優れているか?
  • RQ3合成データで事前学習したモデルは、複雑なオクルージョンや照明条件を伴う実世界の「野生の」画像へどの程度汎化できるか?
  • RQ4ガウス、ラプラシアン、チェビシェフなどの異なるスペクトルフィルタは、メッシュ再構築の正確性と計算効率にどのように影響するか?
  • RQ5最適化に基づくリファインメントは、自己貫通を解消することで再構築メッシュの物理的妥当性を顕著に向上させることができるか?

主な発見

  • ソフトアテンションに基づく統合戦略により、モデルサイズを35%削減した一方で、全統合手法の中で最小の手再構築誤差(6.7 mm)を達成した。
  • チェビシェフスペクトルフィルタ($g_{cheb_3}$)が、性能と効率のバランスが最も良く、合成データセットで1.38 mmの手誤差を達成した。
  • 事前学習バックボーンを凍結した状態で微調整した場合、実データセットでも1.38 mmの手誤差を達成し、実世界データへの効果的な汎化を示した。
  • 最適化に基づくリファインメントステージは、自己貫通が多様なポーズで是正される質的結果から、メッシュ品質の顕著な向上が確認された。
  • モデル圧縮実験では、EfficientNet-B0バックボーンを用いて$V'$を804から80に削減したところ、合計パラメータ数は34.2Mにまで減少し、手誤差は6.89 mmを維持した。これはスケーラビリティを示している。
  • フレームワークは、複雑で自己オクルージョンを伴い、照明条件が厳しいシナリオにおいても、質的結果からAR/VRアプリケーションに適したリアルタイム推論性能を有していることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。