Skip to main content
QUICK REVIEW

[論文レビュー] UnrealCV: Connecting Computer Vision to Unreal Engine

Weichao Qiu, Alan Yuille|arXiv (Cornell University)|Sep 5, 2016
Advanced Image and Video Retrieval Techniques参考文献 20被引用数 14
ひとこと要約

UnrealCVは、Unreal Engine 4用のオープンソースプラグインであり、コンピュータビジョン研究者が内部ゲームデータ構造にアクセスおよび変更できるようにし、カメラのプログラム制御、詳細なグランドトゥルース(例:深度、インスタンスマスク)の抽出、AIフレームワークとの統合を可能にする。これは、非常に現実的な仮想環境における合成データセット生成とディープニューラルネットワークの評価を促進し、Faster R-CNNのオブジェクト検出において顕著な視点依存の性能変動を示している。

ABSTRACT

Computer graphics can not only generate synthetic images and ground truth but it also offers the possibility of constructing virtual worlds in which: (i) an agent can perceive, navigate, and take actions guided by AI algorithms, (ii) properties of the worlds can be modified (e.g., material and reflectance), (iii) physical simulations can be performed, and (iv) algorithms can be learnt and evaluated. But creating realistic virtual worlds is not easy. The game industry, however, has spent a lot of effort creating 3D worlds, which a player can interact with. So researchers can build on these resources to create virtual worlds, provided we can access and modify the internal data structures of the games. To enable this we created an open-source plugin UnrealCV (http://unrealcv.github.io) for a popular game engine Unreal Engine 4 (UE4). We show two applications: (i) a proof of concept image dataset, and (ii) linking Caffe with the virtual world to test deep network algorithms.

研究の動機と目的

  • コンピュータビジョン研究とUnreal Engine 4のゲームエンジンが備える豊富な3次元アセットおよびレンダリング能力を結びつけること。
  • 既存のゲームおよびVRコンテンツを活用することで、手作業による合成仮想世界の構築の限界を克服すること。
  • AIのトレーニングおよび評価のため、カメラ状態、オブジェクト位置、シーンジオメトリなどの内部データ構造へのプログラム制御アクセスを提供すること。
  • Caffeなどのディープラーニングフレームワークとの統合を通じて、仮想環境におけるエンドツーエンドのアルゴリズムテストを可能にすること。
  • 深度、法線、インスタンスマスクなどの豊富なアノテーションを含む、大規模かつ多様な合成データセットの作成を支援すること。

提案手法

  • Unreal Engine 4の内部ゲームエンジンデータを標準化されたAPIを通じて公開するオープンソースのUnreal Engine 4プラグイン、UnrealCVの開発。
  • UnrealCVのコマンドラインインターフェース(例:vset, vget)を用いたカメラ位置・姿勢の制御および画像・グランドトゥルースデータの取得。
  • 仮想世界と外部AIシステム(例:Caffe)の統合により、リアルタイムの推論およびトレーニングを可能にした。
  • ランダム化されたカメラ位置、照明、オブジェクト設定を用いたスクリプトベースの自動化による画像およびアノテーション生成。
  • UnrealCVのカメラおよび状態制御機能を活用した、プログラム可能なナビゲーションと認識を備えた仮想エージェントの実装。
  • Unreal Engine Marketplaceおよびオープンソースプロジェクトからの実世界のデータセットおよび3次元アセットを、テスト可能な仮想環境に適応すること。

実験結果

リサーチクエスチョン

  • RQ1ゲームエンジンは、コンピュータビジョン研究のための内部シーンデータへのプログラム制御アクセスを拡張可能か?
  • RQ2UnrealCVを用いてUnreal Engine 4で生成された合成データセットは、ビジョンアルゴリズムのトレーニングおよびテストに必要な多様性と現実性を十分に満たしているか?
  • RQ3制御されたフォトリッチな仮想環境でテストされた際、Faster R-CNNのようなディープラーニングモデルは視点の変化に対してどの程度感受的か?
  • RQ4UnrealCVは、AIフレームワークと仮想世界の間でシームレスな統合を実現し、エンドツーエンドのアルゴリズム評価を可能にしているか?
  • RQ53次元コンテンツの多様性および物理的現実性の観点から、現在の合成データ生成パイプラインの限界は何か?

主な発見

  • UnrealCVは、Unreal Engine 4におけるカメラ状態、オブジェクト位置、シーンジオメトリへの完全なプログラム制御アクセスを可能にし、仮想世界の認識に対する正確な制御を可能にした。
  • システムは、ランダム化されたカメラ位置およびシーンパラメータを用いて、同期されたRGB、深度、表面法線、インスタンスマスクを備えた合成画像データセットを効果的に生成した。
  • Faster R-CNNのソファ検出における平均平均適合率(AP)は、カメラの視点に応じて0.1から1.0まで顕著に変動し、視点依存性が強いことが示された。
  • 特定の方位角/仰角からソファが見えない場合、APは0.0に低下した。これにより、可視性および隠蔽が検出性能に顕著に影響することが確認された。
  • 照明、素材特性、カメラ設定を変化させることで、アルゴリズムのロバストネスを体系的に評価できる仮想世界が実現された。
  • CaffeとUnrealCVの統合により、フォトリッチなシミュレーション環境でディープネットワークのリアルタイム推論およびテストが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。