Skip to main content
QUICK REVIEW

[論文レビュー] The ParallelEye Dataset: Constructing Large-Scale Artificial Scenes for Traffic Vision Research

Xuan Li, Kunfeng Wang|arXiv (Cornell University)|Dec 22, 2017
Remote Sensing and LiDAR Applications参考文献 22被引用数 9
ひとこと要約

本稿では、ストリートマップデータ、コンピューターグラフィックス、およびルールベースのモデリングを用いてUnity3Dで生成された大規模かつ写真のようにリアルな仮想都市交通シーンであるParallelEyeデータセットを提案する。このパイプラインにより、セマンティックセグメンテーション、インスタンスセグメンテーション、バウンディングボックス、トラッキング、オプティカルフロー、深度の高精度な自動アノテーションが可能となり、制御された照明および天候条件下で多様で正確なデータを実現した。レンダリング速度は8–12 fpsを達成した。

ABSTRACT

Video image datasets are playing an essential role in design and evaluation of traffic vision algorithms. Nevertheless, a longstanding inconvenience concerning image datasets is that manually collecting and annotating large-scale diversified datasets from real scenes is time-consuming and prone to error. For that virtual datasets have begun to function as a proxy of real datasets. In this paper, we propose to construct large-scale artificial scenes for traffic vision research and generate a new virtual dataset called "ParallelEye". First of all, the street map data is used to build 3D scene model of Zhongguancun Area, Beijing. Then, the computer graphics, virtual reality, and rule modeling technologies are utilized to synthesize large-scale, realistic virtual urban traffic scenes, in which the fidelity and geography match the real world well. Furthermore, the Unity3D platform is used to render the artificial scenes and generate accurate ground-truth labels, e.g., semantic/instance segmentation, object bounding box, object tracking, optical flow, and depth. The environmental conditions in artificial scenes can be controlled completely. As a result, we present a viable implementation pipeline for constructing large-scale artificial scenes for traffic vision research. The experimental results demonstrate that this pipeline is able to generate photorealistic virtual datasets with low modeling time and high accuracy labeling.

研究の動機と目的

  • 実世界の交通ビジョンデータセットにおける手作業によるアノテーションの高コストおよび一貫性の欠如を解消すること。
  • 現実世界の地理的構造と視覚的忠実度を再現する大規模かつリアルな仮想都市シーンをスケーラブルに生成するためのパイプラインを開発すること。
  • 合成シーンにおいて、複数のタスク固有のラベル(例:バウンディングボックス、セグメンテーション、トラッキング)を自動的かつ正確に、多様にアノテートできることを実現すること。
  • さまざまな環境条件下で、再現可能で制御可能な環境を提供し、交通ビジョンアルゴリズムの訓練および評価を可能にすること。
  • 実世界のデータ収集およびアノテーションに依存することを減らし、多様性と精度に優れた代替データセットを提供すること。

提案手法

  • 北京の中关村地域の正確な地理的レイアウトを再現するため、実際のストリートマップデータを用いて3次元モデルを構築する。
  • コンピューターグラフィックスおよびバーチャルリアリティ技術を活用し、Unity3Dで写真のようにリアルな都市交通シーンをレンダリングする。
  • 車両、歩行者、および動的環境条件を模擬するルールベースのモデリングを実装する。
  • 搭載型および監視用カメラを仮想的に設定し、位置、高さ、向き、モーショングラフィックスを調整可能にすることで、多様な視点を捉える。
  • 日中、夜明け、夜間の照明条件と、晴れ、曇り、雨、霧の天候条件を動的に変更することで、データの多様性を向上させる。
  • Unity3Dのレンダリングパイプラインを活用し、セマンティック/インスタンスセグメンテーション、オブジェクトのバウンディングボックス、トラッキング、オプティカルフロー、深度の正確なグランドトゥルースラベルを自動生成する。

実験結果

リサーチクエスチョン

  • RQ1高精度な地理的・視覚的忠実度を備えた大規模な合成都市交通シーンを、現実世界の条件に近づけて構築できるか?
  • RQ2仮想環境内で、セグメンテーション、バウンディングボックス、トラッキングなどの複数タスクのグランドトゥルースアノテーションを信頼性高く自動生成できるか?
  • RQ3照明や天候の制御された変化が、実世界のデータ収集なしに、どの程度データの多様性を向上させられるか?
  • RQ4写真のようにリアルなラベル付き仮想データセットを、交通ビジョン研究に適した効率的かつスケーラブルなパイプラインとして実現できるか?
  • RQ5得られた合成データセットが、複雑な都市環境におけるビジョンモデルの訓練および評価を効果的に支援できるか?

主な発見

  • ParallelEyeデータセットは、セマンティックセグメンテーション、インスタンスセグメンテーション、バウンディングボックス、トラッキング、オプティカルフロー、深度の複数タスクにおいて、完全に自動化され正確なアノテーションが施された31,000フレームの画像フレームを含む。
  • データセット生成パイプラインは、標準のワークステーションでも8–12フレーム/秒の速度で動作し、大規模なデータ合成を効率的に行える。
  • 照明や天候条件を動的に変更することで、再収集や再アノテーションなしに多様なシーン変化を生成できる。
  • 仮想シーンは高い視覚的忠実度と地理的正確性を達成しており、現実世界の都市レイアウトと外観に極めて近い。
  • カメラの設定(位置、高さ、向き)を柔軟に変更可能であり、搭載型および監視カメラの両方の視点を模擬できる。
  • データセットは専用のウェブサイトを通じて公開されており、将来的な交通ビジョン研究およびモデルの一般化性向上を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。