Skip to main content
QUICK REVIEW

[論文レビュー] Recovering and Simulating Pedestrians in the Wild

Ze Yang, Siva Manivasagam|arXiv (Cornell University)|Nov 16, 2020
Human Pose and Action Recognition参考文献 39被引用数 6
ひとこと要約

本稿では、実世界のLiDARおよびカメラシーケンスから、3次元スキャンやポーズアノテーションの教師データを一切用いずに、3次元歩行者形状と動きを回復するためのLiMEという手法を提案する。形状の事前知識、再投影一貫性、LiDARレイトレイティングを組み合わせた深層学習とエネルギー最小化により、LiDARシミュレーション用に現実的で高品質な歩行者アセットを生成し、実際のアノテート済みデータの必要性を低減するとともに、データ拡張によって歩行者検出性能を最大3 APポイント向上させる。

ABSTRACT

Sensor simulation is a key component for testing the performance of self-driving vehicles and for data augmentation to better train perception systems. Typical approaches rely on artists to create both 3D assets and their animations to generate a new scenario. This, however, does not scale. In contrast, we propose to recover the shape and motion of pedestrians from sensor readings captured in the wild by a self-driving car driving around. Towards this goal, we formulate the problem as energy minimization in a deep structured model that exploits human shape priors, reprojection consistency with 2D poses extracted from images, and a ray-caster that encourages the reconstructed mesh to agree with the LiDAR readings. Importantly, we do not require any ground-truth 3D scans or 3D pose annotations. We then incorporate the reconstructed pedestrian assets bank in a realistic LiDAR simulation system by performing motion retargeting, and show that the simulated LiDAR data can be used to significantly reduce the amount of annotated real-world data required for visual perception tasks.

研究の動機と目的

  • 自律走行車両の認識訓練およびテストのためのスケーラブルで現実的な歩行者シミュレーションの不足を解消すること。
  • 教師付き3次元スキャンやポーズアノテーションが不要な、非構造的で実世界のセンサデータ(LiDARとカメラ)から正確な3次元歩行者形状と動きを回復すること。
  • ドメインギャップを低減し、データアノテーションコストを削減するために、LiDARシミュレーションシステムで使用可能な多様なシミュレーテッド歩行者アセットのバンクを生成すること。
  • 認識モデルの評価を通じてシミュレーテッドLiDARデータの現実性を検証し、データ拡張による性能向上を示すこと。

提案手法

  • 形状の事前知識、2次元キーポイントの再投影、LiDARレイトレイティングの一貫性を統合した、エネルギー最小化に基づく深層構造的モデルを用いて歩行者再構築を定式化する。
  • 1つの低コストのアーティスト作成メッシュを形状の事前知識として用い、実世界の多様な歩行者ジオメトリの再構築を支援する。
  • カメラ画像からのマルチビュー2次元ポーズ推定を活用し、再投影一貫性を強制することで3次元ポーズの精度を向上させる。
  • 再構築された3次元メッシュが観測されたLiDARポイントクラウドと整合するようにレイトレイターを適用し、幾何的正確性を向上させる。
  • 再構築された歩行者に対してモーションリターゲティングを適用し、シミュレーテッド都市シーン内で新規で多様な行動と配置を生成する。
  • 再構築されたアセットをLiDARsimシミュレーションシステムに統合し、最小限のsim2realドメインギャップで現実的なLiDARポイントクラウドを生成する。

実験結果

リサーチクエスチョン

  • RQ1教師付き3次元アノテーションが不要な状態で、非構造的で実世界のLiDARおよびカメラシーケンスから3次元歩行者形状と動きを正確に回復できるか?
  • RQ2学習された形状の事前知識とマルチモーダルセンサの一貫性を組み合わせることで、シミュレーション用に現実的で高品質な歩行者メッシュを生成できるか?
  • RQ3回復された歩行者から生成されたシミュレーテッドLiDARデータは、認識システムにおけるsim2realドメインギャップをどの程度低減できるか?
  • RQ4限られた実データでのデータ拡張に使用した場合、シミュレーテッドLiDARデータは歩行者検出性能を顕著に向上させられるか?

主な発見

  • 提案手法LiMEは、定性的な結果から示されるように、元のLiDARシーケンスからの最小限のずれで高い幾何的正確性を達成している。
  • 再構築された歩行者を用いて生成されたシミュレーテッドLiDARデータは、ドメインギャップが小さく、実データで訓練された検出器を評価した際、IoU 0.5でのAPポイント低下がたった0.7ポイントにとどまる。
  • 10万件のシミュレーテッドLiDAR例を用いたデータ拡張により、実データのみを用いた場合に比べて歩行者検出APが最大3ポイント向上し、特に実データが限られた状況で顕著な向上が見られた。
  • 同一のシーンレイアウトとトラジェクトリを用いても、10万件の実データと10万件のシミュレーテッドデータを組み合わせることで、APが1.7ポイント向上し、多様なシミュレーテッドシーケンスの価値を示している。
  • 本手法は、遮蔽、グループ間の相互作用、スマートフォンを覗くような安全上の懸念がある行動を含む多様な歩行者行動を効果的に生成できており、認識システムの耐障害性テストを強化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。