Skip to main content
QUICK REVIEW

[論文レビュー] A Dataset of Relighted 3D Interacting Hands

Gyeongsik Moon, Shunsuke Saito|arXiv (Cornell University)|Oct 26, 2023
Hand Gesture Recognition Systems被引用数 4
ひとこと要約

本論文では、現実的で多様な画像外観と正確な3Dアノテーションポーズを併せ持つ、リライトされた3D相互作用手の大型スケールデータセットRe:InterHandを紹介する。マルチカメラスタジオで正確に追跡された3D手ポーズに、最先端の手リライトネットワークを適用することで、外観の高リアルさと多様性を実現しながらも、強力な3Dポーズ精度を維持し、既存のデータセットよりもリアルさとアノテーション品質の両面で優れている。

ABSTRACT

The two-hand interaction is one of the most challenging signals to analyze due to the self-similarity, complicated articulations, and occlusions of hands. Although several datasets have been proposed for the two-hand interaction analysis, all of them do not achieve 1) diverse and realistic image appearances and 2) diverse and large-scale groundtruth (GT) 3D poses at the same time. In this work, we propose Re:InterHand, a dataset of relighted 3D interacting hands that achieve the two goals. To this end, we employ a state-of-the-art hand relighting network with our accurately tracked two-hand 3D poses. We compare our Re:InterHand with existing 3D interacting hands datasets and show the benefit of it. Our Re:InterHand is available in https://mks0601.github.io/ReInterHand/.

研究の動機と目的

  • 2本の手の相互作用を対象とした、多様で現実的な画像外観と大規模かつ正確な3D手ポーズアノテーションを同時に提供するデータセットの不足を解消すること。
  • 既存のデータセットの限界(実験室ベース:外観が単調、自然な状況:スケールと正確性が限定的、合成データ:照明の一貫性がない)を克服し、各アプローチの長所を統合すること。
  • 学習済みリライトネットワークを用いて、現実的な照明と反射を再現した画像を生成することで、実世界(イン・ザ・ワイルド)の状況においてより頑健な3D手ポーズ推定を可能にすること。
  • エゴセントリックおよび第三者視点の両方を含む、現実的な視覚的条件下で3D相互作用手の復元手法を評価するためのベンチマークを提供すること。
  • 多様な手ポーズと写真のようにリアルなレンダリングを備えた大規模で高品質なデータセットを提供することで、3D手ポーズ推定分野の研究を促進すること。

提案手法

  • 100台の同期カメラを用いたマルチカメラスタジオ環境を活用し、高精細な3D関節およびMANOメッシュアノテーションを保証する高精度な3D手ポーズを取得する。
  • 単一手データで事前学習された最先端の手リライトネットワークを用い、高解像度の環境マップを用いて多様な照明条件のもとで3D手メッシュに現実的な照明を再現する。
  • 変化するポーズ、照明、背景を用いて3D手メッシュをレンダリングし、150万枚の画像を生成することで、現実的な肌色と反射を維持する。
  • 環境マップを用いて実世界の照明変動を模擬し、外観の多様性を高める一方で、手の幾何学的形状と照明の一貫性を保つ。
  • アダイン(AdaIN)などの後処理技術を適用して、前面の手と背景の色調を調和させようとしたが、反射の不正確さのため、限定的な成功にとどまった。
  • 個人を特定できる情報の排除と同意書の取得により、データ品質を確保し、プライバシーを保護しながらもデータの有用性を維持する。

実験結果

リサーチクエスチョン

  • RQ13D手のデータセットは、現実的で多様な画像外観と大規模かつ正確な3Dポーズアノテーションを統合することで、実世界の設定における一般化性能を向上させることができるか?
  • RQ2学習済みネットワークを用いて3D手メッシュをリライトすることは、実世界およびイン・ザ・ワイルドなデータに対して3D手ポーズ推定モデルの性能にどのように影響を与えるか?
  • RQ3本手法が、既存のデータセットと比較して、リアルさ、ポーズの多様性、3D正確性の観点でどの程度優れているか?
  • RQ4Re:InterHandで学習させることで、エゴセントリックおよび第三者視点の状況における一般化性能が、既存のベンチマークと比較して向上するか?
  • RQ5現在のリライトネットワークは、複雑な2本の手の相互作用シナリオに適用した際に、どのような限界を示すか?

主な発見

  • Re:InterHandの自作テストスプリットで微調整した場合、エゴセントリックビューにおいて20.07 RRVEを達成し、ベースラインのInterWildモデル(28.89 RRVE)を顕著に上回った。
  • リライト段階により、HIC(実世界データセット)における誤差は67.11から52.91 RRVEに低下し、自然な画像外観への一般化性能の向上が示された。
  • Re:InterHandで微調整した場合、InterHand2.6Mにおける誤差は19.74から19.40 RRVEに2.4%低下し、実験室ベースのデータに対してもより頑健な性能を示した。
  • リライトプロセスにより、肌色や現実的な照明が保持され、前景と背景の間で照明の一貫性に欠ける単純な合成手法よりも優れた性能を発揮した。
  • 課題はあったが、リライトネットワークは2本の手の相互作用に対してもある程度の汎用性を示したが、単一手データから2本の手データへのドメインシフトに起因する、まれに発生するアーティファクトが存在した。
  • 本データセットにより、第3者視点およびエゴセントリックベンチマークの両方で最先端の性能が達成され、実世界の3D手ポーズ推定における実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。