Skip to main content
QUICK REVIEW

[論文レビュー] TöRF: Time-of-Flight Radiance Fields for Dynamic Scene View Synthesis

Benjamin Attal, Eliot Laidlaw|ArXiv.org|Sep 30, 2021
Advanced Vision and Imaging参考文献 50被引用数 10
ひとこと要約

TöRF は、RGB と生の時間飛行(ToF)位相データを同時に最適化することで、動的シーンのビュー合成を向上させるニューラルレイトランスフィールド表現を導入する。深度マップではなく、連続波 ToF センサ測定値を直接モデル化することにより、低反射率、マルチパス干渉、大規模な動きといった困難な状況下でもより頑健な再構築を実現し、定性的および定量的な評価において NeRF や動的シーンベースラインを上回る性能を発揮する。

ABSTRACT

Neural networks can represent and accurately reconstruct radiance fields for static 3D scenes (e.g., NeRF). Several works extend these to dynamic scenes captured with monocular video, with promising performance. However, the monocular setting is known to be an under-constrained problem, and so methods rely on data-driven priors for reconstructing dynamic content. We replace these priors with measurements from a time-of-flight (ToF) camera, and introduce a neural representation based on an image formation model for continuous-wave ToF cameras. Instead of working with processed depth maps, we model the raw ToF sensor measurements to improve reconstruction quality and avoid issues with low reflectance regions, multi-path interference, and a sensor's limited unambiguous depth range. We show that this approach improves robustness of dynamic scene reconstruction to erroneous calibration and large motions, and discuss the benefits and limitations of integrating RGB+ToF sensors that are now available on modern smartphones.

研究の動機と目的

  • 単眼動的新ビュー合成の不適切な性質を、物理的センサ測定値を組み込むことで解決すること。
  • 低反射率領域、マルチパス干渉領域、大規模な動きの状況下での再構築の頑健性を向上させること。
  • 生の ToF 位相データ(処理済み深度マップではなく)を用いることで、優れたビュー合成性能が得られることを実証すること。
  • RGB+ToF センサ統合を活用することで、少ない入力ビューでより正確で安定した動的シーン再構築を可能にすること。
  • 最新のスマートフォン対応 RGB+ToF センサをニューラルレイトランスフィールドフレームワークに統合する可能性を検討すること。

提案手法

  • 本手法は、RGB および連続波 ToF 位相測定値の両方を同時に最適化する物理ベースのニューラルボリュームレンダリングモデルを定式化する。
  • 位相表現を用いて生の ToF センサ応答をモデル化し、変調光の位相と振幅を符号化することで、曇りのない深度範囲を超える情報も保持する。
  • 最適化プロセスは、RGB 画像および位相画像の両方の光度誤差を同時に最小化し、シーンの幾何構造と外観をエンドツーエンドで学習可能にする。
  • 学習された暗黙的レイトランスフィールドから色信号および位相信号をレンダリングするために、微分可能なレイマーチング手順を用いる。
  • 高精細な動的シーンを効率的に表現するために、マルチスケール・マルチリゾリューションのネットワークアーキテクチャを活用する。
  • 本手法は、ハンドヘルドデバイスから取得した RGB+ToF シーケンスをエンドツーエンドで学習し、少数のビューからの再構築を可能にする。

実験結果

リサーチクエスチョン

  • RQ1生の時間飛行位相測定値を用いることで、導出された深度マップに比べ、動的シーンのビュー合成が向上するか?
  • RQ2物理的 ToF センサデータを組み込むことで、低反射率、マルチパス干渉、大規模な動きに対する頑健性がどのように向上するか?
  • RQ3RGB と ToF データの共同最適化が、高品質な新ビュー合成に必要な入力ビュー数をどの程度削減できるか?
  • RQ4困難な条件下で、本手法は NeRF や既存の動的シーンベースラインと比べてどの程度の性能を発揮するか?
  • RQ5最新のスマートフォン統合型 RGB+ToF センサを用いることで、ニューラルシーン再構築にどのような実用的利点と制限が生じるか?

主な発見

  • TöRF は、複雑な幾何構造と動的運動を示す領域においても、少数のビューでの静的シーンに対して NeRF より優れた新ビュー合成品質を達成する。
  • 本手法は、2つの最先端の動的シーンベースライン [52, 26] よりも定量的指標および視覚的品質の両面で顕著に優れており、とくに暗い領域や低反射率領域の処理において顕著である。
  • 処理済み深度マップではなく生の ToF 位相データを用いることで、マルチパス干渉領域や曇りのない深度範囲を超える領域においても、より正確な再構築が可能になる。
  • TöRF は、カメラキャリブレーション誤差や大規模な動きに対する頑健性が向上しており、これらは単眼動的 NVS において性能を著しく低下させる要因である。
  • 本手法は、少ない入力ビューで高精細な再構築を実現し、動的シーンキャプチャにおけるデータ取得負荷を軽減する。
  • 改善が見られる一方で、斜めの角度で非常に暗く動的である対象物(例:髪)の再構築には課題が残っており、極端な運動や反射率に対する現在のニューラル能力の限界を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。