Skip to main content
QUICK REVIEW

[論文レビュー] BIM Hyperreality: Data Synthesis Using BIM and Hyperrealistic Rendering for Deep Learning

Mohammad Alawadhi, Wei Qi Yan|arXiv (Cornell University)|May 10, 2021
3D Surveying and Cultural Heritage参考文献 23被引用数 6
ひとこと要約

本論文では、建築情報モデリング(BIM)とハイパーサンキュラスレンダリングを組み合わせることで、深層学習向けの写真並みの訓練データを合成する手法、BIMハイパーサンキュラスを提案する。BIMに基づく意味的ラベルと、同じ建物からのレンダリング画像を用いて、著者たちは実写写真における建築オブジェクトを認識できるGANを訓練した—実際の訓練画像を一切使用せず、高い精度を達成した。これにより、視覚理解における建築分野における合成データの有効性が示された。

ABSTRACT

Deep learning is expected to offer new opportunities and a new paradigm for the field of architecture. One such opportunity is teaching neural networks to visually understand architectural elements from the built environment. However, the availability of large training datasets is one of the biggest limitations of neural networks. Also, the vast majority of training data for visual recognition tasks is annotated by humans. In order to resolve this bottleneck, we present a concept of a hybrid system using both building information modeling (BIM) and hyperrealistic (photorealistic) rendering to synthesize datasets for training a neural network for building object recognition in photos. For generating our training dataset BIMrAI, we used an existing BIM model and a corresponding photo-realistically rendered model of the same building. We created methods for using renderings to train a deep learning model, trained a generative adversarial network (GAN) model using these methods, and tested the output model on real-world photos. For the specific case study presented in this paper, our results show that a neural network trained with synthetic data; i.e., photorealistic renderings and BIM-based semantic labels, can be used to identify building objects from photos without using photos in the training data. Future work can enhance the presented methods using available BIM models and renderings for more generalized mapping and description of photographed built environments.

研究の動機と目的

  • 建築分野における視覚認識のための、大規模かつ正確にアノテートされた訓練データセットの不足に取り組むこと。
  • 深層学習モデルの訓練に人為的アノテート済みの実世界画像への依存を減らすこと。
  • BIMとハイパーサンキュラスレンダリングから生成された合成データを用いて、神経ネットワークが建築要素を認識できるかどうかの可能性を検討すること。
  • 合成データにのみ訓練されたモデルが、実世界の写真に一般化できるかどうかを評価すること。
  • 既存のBIMおよびレンダリング資産を用いて、多様で意味的にラベル付けされた訓練データをスケーラブルに生成するパイプラインを確立すること。

提案手法

  • 著者たちは、既存のBIMモデルと、同じ建物の写真並みのレンダリング画像を組み合わせて、データ合成の基盤として用いた。
  • BIMモデルから得られた意味的ラベルを、レンダリング画像の対応するピクセルにマッピングすることで、完全にアノテートされた合成データセット(BIMrAI)を構築した。
  • 条件付き生成対抗ネットワーク(cGAN)を合成データセット上で訓練し、画像特徴からオブジェクトカテゴリへのマッピングを学習させた。
  • 訓練プロセスでは、レンダリングの視覚的リアリズムとBIMの幾何学的・意味的正確性を活用し、モデルの一般化性能を向上させた。
  • 訓練中に見られなかった実写写真を用いて、訓練済みのGANを評価し、ゼロショット一般化能力をテストした。
  • この手法により、実際の画像を一切使用せず、合成データのみでエンドツーエンドの認識モデルの訓練が可能になった。

実験結果

リサーチクエスチョン

  • RQ1BIMと写真並みのレンダリングから生成された合成データおよびBIMに基づく意味的ラベルにのみ訓練された深層学習モデルは、実世界の写真における建築オブジェクトを認識できるか?
  • RQ2実際の画像で微調整を行わず、合成データで訓練されたGANは、実世界の視覚入力にどの程度一般化できるか?
  • RQ3BIMから得られる意味的アノテーションは、合成訓練データにおけるオブジェクト認識の精度と頑健性をどの程度向上できるか?
  • RQ4BIMとレンダリングを用いて、大規模かつ意味的に豊富な訓練データを自動でスケーラブルに生成するパイプラインを構築することは可能か?
  • RQ5BIMとハイパーサンキュラスレンダリングを用いて生成された合成データで訓練されたモデルと、実データで訓練されたモデルとの性能差はどの程度か?

主な発見

  • BIMと写真並みのレンダリングから生成された合成データにのみ訓練されたGANモデルは、実世界の写真における建物オブジェクトの識別において高い精度を達成した。
  • モデルは強力なゼロショット一般化を示し、実際の訓練データに触れることなく、実写画像でも効果的に動作した。
  • BIMに基づく意味的ラベルとハイパーサンキュラスレンダリングの統合により、合成訓練データの質と一貫性が著しく向上した。
  • 本手法により、人為的アノテート済みの実画像を一切使用せず、大規模で多様で正確にアノテートされたデータセットの作成が可能になった。
  • BIMとハイパーサンキュラスレンダリングを用いて生成された合成データが、建築オブジェクト認識のための実世界データセットの代替として有効であることが検証された。
  • 本手法は、建築および都市環境における視覚タスクのための自動データ合成の今後の研究の基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。