Skip to main content
QUICK REVIEW

[論文レビュー] MATLABER: Material-Aware Text-to-3D via LAtent BRDF auto-EncodeR

Xudong Xu, Zhaoyang Lyu|arXiv (Cornell University)|Aug 18, 2023
Image Processing and 3D ReconstructionComputer Science被引用数 3
ひとこと要約

MATLABERは、現実世界のBRDFデータセットで訓練された潜在BRDF自己符号化器を用いて、環境照明から物質を分離する、物質に配慮したテキストから3Dへの生成フレームワークを提案する。RAW BRDFパラメータの代わりに潜在BRDFコードを予測することで、高精細で現実的な物質を実現し、リライトや物質編集を可能にし、先行手法に比べて現実性、詳細性、分離性において優れた性能を発揮する。

ABSTRACT

Based on powerful text-to-image diffusion models, text-to-3D generation has made significant progress in generating compelling geometry and appearance. However, existing methods still struggle to recover high-fidelity object materials, either only considering Lambertian reflectance, or failing to disentangle BRDF materials from the environment lights. In this work, we propose Material-Aware Text-to-3D via LAtent BRDF auto-EncodeR ( extbf{MATLABER}) that leverages a novel latent BRDF auto-encoder for material generation. We train this auto-encoder with large-scale real-world BRDF collections and ensure the smoothness of its latent space, which implicitly acts as a natural distribution of materials. During appearance modeling in text-to-3D generation, the latent BRDF embeddings, rather than BRDF parameters, are predicted via a material network. Through exhaustive experiments, our approach demonstrates the superiority over existing ones in generating realistic and coherent object materials. Moreover, high-quality materials naturally enable multiple downstream tasks such as relighting and material editing. Code and model will be publicly available at \url{https://sheldontsui.github.io/projects/Matlaber}.

研究の動機と目的

  • 既存のテキストから3Dへの生成手法が、環境照明から分離された高精細で現実的な物質を生成する点での制限を解消すること。
  • 大規模な現実世界のBRDFコレクション(例:TwoShotBRDF)を活用し、潜在空間における自然な物質分布の滑らかで連続的な分布を学習すること。
  • 正確で編集可能なBRDF表現を生成することで、リライトや物質編集などの下流タスクを可能にすること。
  • 直接BRDF予測を置き換える潜在コード最適化により、テキストから3D合成における外観品質と一貫性を向上させること。

提案手法

  • 大規模な現実世界のBRDFデータ(例:TwoShotBRDF)で訓練された、新しい潜在BRDF自己符号化器を用い、自然な物質分布を表す滑らかで連続的な潜在空間を学習する。
  • 自己符号化器はRAW BRDFをコン pact で分離された潜在コードにマッピングし、テキストから3Dパイプラインにおける物質生成の事前分布として機能する。
  • テキストから3D生成の過程では、RAW BRDFパラメータの予測ではなく、テキストプロンプトに条件づけられた潜在BRDF埋め込みを物質ネットワークが予測する。
  • NeRFまたはDMTet表現を用いた拡散ベースの3D生成フレームワーク(例:SDS損失)を採用し、予測された潜在BRDFコードを用いて外観を最適化する。
  • 潜在空間の滑らかさのおかげで、照明条件が変化しても現実的で一貫性のある物質生成が可能になる。
  • 潜在BRDFコードの補間によりリライトや物質編集が可能となり、物質タイプ間の自然な変化(例:ゴブレットのゴールドからシルバーへの滑らかな移行)が実現できる。

実験結果

リサーチクエスチョン

  • RQ1現実世界のBRDFデータで訓練された潜在BRDF自己符号化器は、テキストから3D生成において、物質を環境照明から効果的に分離できるか?
  • RQ2RAW BRDFパラメータの代わりに潜在BRDFコードを予測することで、より現実的で一貫性のある物質生成が可能になるか?
  • RQ3生成されたBRDF物質は、リライトや物質編集といった実用的下流タスクをサポートできるか?
  • RQ4最先端のテキストから3Dモデルと比較して、本手法は物質の現実性、詳細性、分離性において優れているか?

主な発見

  • ユーザー研究の結果、MATLABERはDreamFusion、Magic3D、Fantasia3Dと比較して、物質の現実性、詳細性、分離性において優れた性能を示した。
  • 80名の参加者を対象としたユーザー研究では、MATLABERがすべてのベースラインを大きく上回り、特に分離性スコアで顕著な優位性を示した。
  • さまざまなHDR環境マップ下でも、写真合成的リライトが可能で、照明条件の変化に応じて一貫性があり自然な外観の変化が得られた。
  • 潜在コードのブレンドによる物質の補間により、ゴールドからシルバーへの移行など、滑らかで視覚的に妥当な物質変化が実現した。
  • 本フレームワークは高精細な物質編集とシーン操作を可能にし、従来のテキストから3Dモデルでは実現できなかった応用を可能にした。
  • 高品質な物質を実現したが、不完全な幾何構造のため、新しい照明条件下でアーティファクトが発生する場合があり、今後の研究課題として幾何構造の最適化が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。