Skip to main content
QUICK REVIEW

[論文レビュー] RenderMe-360: A Large Digital Asset Library and Benchmarks Towards High-fidelity Head Avatars

Dongwei Pan, Zhuo Long|arXiv (Cornell University)|May 22, 2023
Face recognition and analysis被引用数 5
ひとこと要約

RenderMe-360 は、500体の多様なアイデンティティから得られた 24300 万フレーム以上の高精細 4D デジタルアセットライブラリを備えた大規模かつ高精細な 4D データセットを提供する。60台の同期化された 2K カメラを用いて 30 FPS で撮影されたもので、新規ビューと表現の再現、髪の毛のレンダリング、編集、会話するヘッドジェネレーションの 5 つの主要タスクにおいて 16 種類の最先端手法を包括的にベンチマーク可能であり、現行モデルの多様な現実世界の条件下における頑健性と一般化性能に深刻なギャップが存在することが明らかになった。

ABSTRACT

Synthesizing high-fidelity head avatars is a central problem for computer vision and graphics. While head avatar synthesis algorithms have advanced rapidly, the best ones still face great obstacles in real-world scenarios. One of the vital causes is inadequate datasets -- 1) current public datasets can only support researchers to explore high-fidelity head avatars in one or two task directions; 2) these datasets usually contain digital head assets with limited data volume, and narrow distribution over different attributes. In this paper, we present RenderMe-360, a comprehensive 4D human head dataset to drive advance in head avatar research. It contains massive data assets, with 243+ million complete head frames, and over 800k video sequences from 500 different identities captured by synchronized multi-view cameras at 30 FPS. It is a large-scale digital library for head avatars with three key attributes: 1) High Fidelity: all subjects are captured by 60 synchronized, high-resolution 2K cameras in 360 degrees. 2) High Diversity: The collected subjects vary from different ages, eras, ethnicities, and cultures, providing abundant materials with distinctive styles in appearance and geometry. Moreover, each subject is asked to perform various motions, such as expressions and head rotations, which further extend the richness of assets. 3) Rich Annotations: we provide annotations with different granularities: cameras' parameters, matting, scan, 2D/3D facial landmarks, FLAME fitting, and text description. Based on the dataset, we build a comprehensive benchmark for head avatar research, with 16 state-of-the-art methods performed on five main tasks: novel view synthesis, novel expression synthesis, hair rendering, hair editing, and talking head generation. Our experiments uncover the strengths and weaknesses of current methods. RenderMe-360 opens the door for future exploration in head avatars.

研究の動機と目的

  • AR/VR やメタバース分野における人間の頭部アバター研究において、大規模で多様性に富み、高精細な 4D データセットが不足している問題を解決すること。
  • 従来のデータセットがスケールが小さく、属性の多様性(例:年齢、人種、表情、アクセサリー)に乏しく、アノテーションが疎であるという制限を克服すること。
  • 新規ビュー再現、表情移転、会話するヘッドジェネレーションなどの複数の下流タスクにおける包括的ベンチマークを可能にすること。
  • 包括的かつ公開可能なデータセットを用いて、幾重にわたるマルチモodal アノテーションを備えることで、頑健で一般化可能なヘッドアバター生成・編集モデルの開発を促進すること。
  • 細分化された多段階のアノテーションを用いて、テキストから 3D ヘッド生成、逆レンダリング、マルチモーダルアバター合成の次世代研究を支援すること。

提案手法

  • 60台の同期化された 2K 業務用カメラを用いた独自開発の高機能データ収集システム、POLICY を導入し、360° ポートレートデータを 30 FPS で撮影。高い写実的表現と幾何的正確性を実現。
  • 年齢、人種、文化、表現行動に多様性を持つ 500 名の被験者を収集。各被験者について、12 種類のピーク表情、42 件のバイリンガルスピーチ、最大 12 種類のヘアスタイルを含む。
  • 豊富な多スケールアノテーションを生成:2D/3D の顔面ランドマーク、背景マットイング、3D 頭部スキャン、FLAME フィッティング、同期音声、各フレームのテキスト記述。
  • 新規ビュー再現、新規表現再現、髪の毛レンダリング、髪の毛編集、会話するヘッドジェネレーションの 5 つのコアタスクにおいて、16 種類の最先端手法を評価する包括的ベンチマークを構築。
  • テキストから 3D ヘッド生成実験において、幾何学的事前知識(例:3D スキャン)やテキストガイダンス(例:CLIP)を、Latent-NeRF や TEXTure といった手法を用いて統合。
  • ランドマーク検出、顔パースング、動画トリミングなどの標準化されたデータ処理パイプラインを導入し、学習および評価における一貫性と正確性を確保。

実験結果

リサーチクエスチョン

  • RQ1現在の最先端ヘッドアバター生成モデルは、大規模かつ高精細な 4D データセットにおいて、多様なアイデンティティ、表情、頭部ポーズの下でどの程度の性能を示すか?
  • RQ2既存の手法は、多様なヘアスタイル、メイク、アクセサリーといった複雑な属性にどの程度一般化できるか?
  • RQ3高精細で多様なヘッドアバターに適用された場合、現在のインバージョンおよび編集技術(例:PTI、HyperStyle)にどのような限界があるか?
  • RQ4テキストから 3D ヘッド生成モデルは、幾何学的事前知識を組み合わせることで、テキストプロンプトのみで現実的でリアルな人間の頭部を生成できるか?
  • RQ5異なるマルチモーダル事前知識(例:スキャン、音声、ランドマーク)は、生成されたヘッドアバターの品質と一貫性にどのように影響を与えるか?

主な発見

  • PTI や HyperStyle といった最先端手法はインバージョン性能に優れるが、特に複雑な条件下においては下流の編集タスクでの一般化性能に欠けることが判明。
  • TEXTure は Latent-NeRF や Dream Fields よりもテキストから 3D ヘッド生成において優れた性能を示し、深度から画像への拡散とメッシュベースのテクスチャマッピングにより、より現実的で詳細な結果を生成。
  • Latent-NeRF でさえ、幾何学的事前知識とテキストガイダンスを用いても、細部のテクスチャ生成に困難を示しており、テキストプロンプトをニューラルインパルシットフィールドに埋め込む段階にボトルネックがあることが示唆された。
  • Dream Fields はテキストプロンプトのみで完全な 3D ヘッドモデルを生成できず、複雑な人間の頭部ジオメトリへの一般化能力の限界が浮き彫りになった。
  • ベンチマークにより、現在のモデルはメイク、アクセサリー、非ニュートラルな表情といった多様な属性に対して頑健でないことが判明し、一般化性能とデータ効率の向上が今後の研究で求められることが示された。
  • RenderMe-360 は、複数のタスクと属性にわたるヘッドアバターモデルの包括的評価を初めて可能にし、リアルさ、多様性、編集可能性の分野における深刻なギャップが明らかになった。今後の研究が解決すべき重要な課題が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。