[論文レビュー] EPIC Fields: Marrying 3D Geometry and Video Understanding
EPIC Fieldsは、単眼自己中心視点動画から追加のスキャンやハードウェアを用いずにフルフレームレートのカメラポーズ軌道を再構築することで、エゴセントリック動画理解のための3D幾何学的構造と動画理解を統合する3D拡張版EPIC-KITCHENSデータセットを導入する。このデータセットは、新規ビュー合成、動的オブジェクトセグメンテーション、半教師付き動画オブジェクトセグメンテーションをサポートし、96%の動画再構築成功率を達成しており、動的コンテンツにおける3D動画理解の課題を浮き彫りにする強力なベースラインを提供する。
Neural rendering is fuelling a unification of learning, 3D geometry and video understanding that has been waiting for more than two decades. Progress, however, is still hampered by a lack of suitable datasets and benchmarks. To address this gap, we introduce EPIC Fields, an augmentation of EPIC-KITCHENS with 3D camera information. Like other datasets for neural rendering, EPIC Fields removes the complex and expensive step of reconstructing cameras using photogrammetry, and allows researchers to focus on modelling problems. We illustrate the challenge of photogrammetry in egocentric videos of dynamic actions and propose innovations to address them. Compared to other neural rendering datasets, EPIC Fields is better tailored to video understanding because it is paired with labelled action segments and the recent VISOR segment annotations. To further motivate the community, we also evaluate two benchmark tasks in neural rendering and segmenting dynamic objects, with strong baselines that showcase what is not possible today. We also highlight the advantage of geometry in semi-supervised video object segmentations on the VISOR annotations. EPIC Fields reconstructs 96% of videos in EPICKITCHENS, registering 19M frames in 99 hours recorded in 45 kitchens.
研究の動機と目的
- 3D幾何学的構造と動画理解を両立できる大規模かつ3Dアノテーション済みのエゴセントリック動画データセットの不足に対処すること。
- 従来の構造からモーション(SfM)手法が高運動量と長時間にわたる動画で失敗する状況においても、動的エゴセントリック動画の信頼性の高い3D再構築を可能にすること。
- 3Dカメラポーズと密なアクションおよびオブジェクトアノテーションを統合することで、ニューラルレンダリングとセマンティック動画理解のための統一されたベンチマークを提供すること。
- 特に動的シーンにおいて、幾何的事前知識が半教師付き動画オブジェクトセグメンテーションの性能向上に寄与することの価値を示すこと。
- スキャンや写真測量の必要性を排除することで、3D動画理解分野における研究者の参入障壁を低減すること。
提案手法
- エゴセントリック動画からフレームをサブサンプリングする前処理パイプラインを提案し、構造からモーション(SfM)再構築の信頼性と速度を向上させる。
- 追加センサーやスキャンを一切使用せずに、単眼エゴセントリック動画シーケンスからフルフレームレートの3Dカメラポーズ軌道を直接再構築する。
- VISORデータセットの密なインスタンスレベルアノテーションを活用し、セマンティックに注意を払った3D動画理解ベンチマークを可能にする。
- 新規のベンチマークタスクを3つ導入:動的新規ビュー合成(NVS)、非教師付き動的オブジェクトセグメンテーション(UDOS)、半教師付き動画オブジェクトセグメンテーション(VOS)。
- 再構築された3D幾何学的構造とセマンティックラベルを用いて、NeRF-W、T-NeRF+、NeuralDiff、MG、STM、XMEMを用いて強力なベースラインを訓練および評価する。
- 同じ再構築パイプラインをEgo4D動画に適用し、EPIC-KITCHENS以外のエゴセントリックデータセットに対しても一般化できることを示す。
実験結果
リサーチクエスチョン
- RQ1追加のハードウェアやスキャンを用いずに、高運動量かつ長時間にわたるエゴセントリック動画において、3Dカメラポーズ再構築を信頼的に達成できるか?
- RQ23D幾何的監視が、動的動画オブジェクトセグメンテーションタスクの性能にどの程度向上効果をもたらすか?
- RQ33D幾何学とセマンティック動画理解を統合することで、複雑なエゴセントリックシーンにおける新規ビュー合成の性能がどの程度向上するか?
- RQ4現在のニューラルレンダリングモデルは、動的で現実世界のエゴセントリック動画データに適用した際に、どのような限界を示すか?
- RQ5提案されたパイプラインは、Ego4Dのような他のエゴセントリック動画データセットに対しても一般化可能か?
主な発見
- EPIC FieldsはEPIC-KITCHENSの96%の動画を正常に再構築し、45のキッチンで99時間にわたる1900万フレームを登録した。
- 提案されたサブサンプリング戦略は、エゴセントリック動画における標準的なSfMパイプラインと比較して、再構築の信頼性と速度を顕著に向上させた。
- 半教師付き動画オブジェクトセグメンテーションは3D幾何的事前知識により恩恵を受ける。固定3Dベースラインは静的オブジェクトでは2Dベースラインを上回るが、動的オブジェクトでは両者とも失敗する。
- 新規ビュー合成および動的オブジェクトセグメンテーションのベースラインは静的または低運動シーンでは優れた性能を示すが、高運動量の動的シーンでは困難を示しており、現在の手法におけるギャップを示唆している。
- パイプラインはEgo4D動画に対しても一般化可能であり、はしごの登り下り、かがむ動作、移動中のナビゲーションといった挑戦的なシナリオでもカメラポーズを正常に再構築できた。
- データセットは http://epic-kitchens.github.io/epic-fields で公開されており、今後の研究において現実世界のエゴセントリックデータを用いた3D動画理解の促進が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。