Skip to main content
QUICK REVIEW

[論文レビュー] DOVE: Learning Deformable 3D Objects by Watching Videos

Shangzhe Wu, Tomáš Jakab|arXiv (Cornell University)|Jul 22, 2021
3D Shape Modeling and Analysis参考文献 67被引用数 14
ひとこと要約

DOVEは、キーポイント、視点、テンプレートの監視なしに、単眼動画から可動物体カテゴリの詳細でテクスチャのあるアーティキュレートな3Dモデルを学習する。時間的対応関係を活用し、対称性に起因するポーズのあいまいさを解消することで、形状、ポーズ、テクスチャを分離し、テスト時に1枚の画像から時間的に一貫性があり、アニメーション可能な3D再構成を達成する。

ABSTRACT

Learning deformable 3D objects from 2D images is often an ill-posed problem. Existing methods rely on explicit supervision to establish multi-view correspondences, such as template shape models and keypoint annotations, which restricts their applicability on objects "in the wild". A more natural way of establishing correspondences is by watching videos of objects moving around. In this paper, we present DOVE, a method that learns textured 3D models of deformable object categories from monocular videos available online, without keypoint, viewpoint or template shape supervision. By resolving symmetry-induced pose ambiguities and leveraging temporal correspondences in videos, the model automatically learns to factor out 3D shape, articulated pose and texture from each individual RGB frame, and is ready for single-image inference at test time. In the experiments, we show that existing methods fail to learn sensible 3D shapes without additional keypoint or template supervision, whereas our method produces temporally consistent 3D models, which can be animated and rendered from arbitrary viewpoints.

研究の動機と目的

  • キーポイント、視点、テンプレート形状などの明示的幾何監視なしに、整理されていない単眼動画から3D可動物体カテゴリを学習すること。
  • 複数フレームの対応関係を確立することで、2D画像からの3D再構成の不適切な性質を克服すること。
  • 階層的な3Dモデルを用いて、カテゴリレベルの形状事前知識、インスタンス固有の変形、時間依存のアーティキュレートなポーズを分離すること。
  • 単一画像からの正確で時間的に一貫性のある3D再構成とレンダリングを、単に動画データで訓練されたモデルを用いて実現すること。
  • キーポイントやテンプレートの監視を自己教師付き動画学習に置き換えることで、高価な手動アノテーションへの依存を減らすこと。

提案手法

  • 手動アノテーションを避けるために、市販のインスタンスセグメンテーションおよびオプティカルフローモデルを用いて、動画から2Dマスクと対応関係を抽出する。
  • 1フレームあたり2つの対称的仮説のみを探索することで、従来の手法と比べて探索空間を著しく削減し、2Dから3Dへの視点のあいまいさを解消する。
  • カテゴリレベルの形状事前知識、インスタンス固有の変形、時間依存のアーティキュレートなポーズを分離する階層的3D形状表現を採用する。
  • 一般化性と形状の一貫性を向上させるために、標準形状およびテクスチャに左右対称性を強制する。
  • 動画内でのインスタンス固有の対応関係と、複数の動画間でのインスタンスに依存しない対応関係を活用し、共有される3D事前知識を学習する。
  • 動画の監視を用いて一貫性を保つように、1枚の画像からテクスチャ付きのアーティキュレートな3Dメッシュを予測するエンドツーエンド微分可能なモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1幾何監視が一切ない未整理な動画から、3D再構成モデルが意味のある形状とポーズの分離を学習できるか?
  • RQ2キーポイントやテンプレートの監視なしに、動画の対称性と時間的一致性をどのように活用して3D視点のあいまいさを解消できるか?
  • RQ3動画データからカテゴリレベルの形状事前知識をどれだけ学習できるか、未観測インスタンスの再構成にどのように寄与するか?
  • RQ43D形状の正確性と視点一般化性能の観点で、動画ベースの学習は単一画像手法と比べてどの程度優れているか?
  • RQ5多様で日常的な動画で訓練されたモデルは、1枚の画像から時間的に一貫性があり、アニメーション可能な3Dメッシュを生成できるか?

主な発見

  • 完全なDOVEモデルは、おもちゃの鳥データセットで1.51 ± 0.89 cmのチェンバードイスタンスを達成し、アブレーションバージョンを著しく上回る。
  • 2視点のあいまいさ解消を削除すると、チェンバードイスタンスは2.52 ± 1.41 cmに上昇し、ポーズ推定におけるその重要性が示された。
  • 対称性制約を省略すると、チェンバードイスタンスは2.19 ± 1.24 cmに上昇し、対称性が形状回復の強力な事前知識であることが示された。
  • 動画学習を省略すると、チェンバードイスタンスは2.20 ± 1.03 cmに上昇し、動画がオブジェクトの全360°幾何を発見する上で重要であることが示された。
  • 学習されたカテゴリレベルの形状事前知識を削除すると、チェンバードイスタンスは3.92 ± 1.47 cmに上昇し、共有される形状のインダクティブバイアスの利点が証明された。
  • 定性的な結果では、DOVEが時間的に一貫性があり、現実的で、任意の視点からアニメーション可能かつレンダラブルな3Dメッシュを生成していることが示された。これはキーポイント監視を必要とする手法とは対照的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。