Skip to main content
QUICK REVIEW

[論文レビュー] IRS: A Large Synthetic Indoor Robotics Stereo Dataset for Disparity and Surface Normal Estimation.

Qiang Wang, Shizhen Zheng|arXiv (Cornell University)|Dec 20, 2019
Advanced Vision and Imaging参考文献 20被引用数 16
ひとこと要約

本論文では、100,000枚を超えるステレオRGB画像と高精度な真値不一致マップおよび表面法線マップを備えた大規模な合成屋内ステレオデータセットであるIRSを紹介する。このデータセットは、実際の視覚効果を模擬するためのカスタムレンダリングエンジンを用いて生成されたもので、著者らはIRS上で訓練されたディーパンラーニングモデルであるDispNormNetを提案し、屋内シーンにおける同時不一致と表面法線推定で最先端の性能を達成した。

ABSTRACT

Indoor robotics localization, navigation and interaction heavily rely on scene understanding and reconstruction. Compared to monocular vision which usually does not explicitly introduce any geometrical constraint, stereo vision based schemes are more promising and robust to produce accurate geometrical information, such as surface normal and depth/disparity. Besides, deep learning models trained with large-scale datasets have shown their superior performance in many stereo vision tasks. However, existing stereo datasets rarely contain the high-quality surface normal and disparity ground truth, which hardly satisfy the demand of training a prospective deep model for indoor scenes. To this end, we introduce a large-scale synthetic indoor robotics stereo (IRS) dataset with over 100K stereo RGB images and high-quality surface normal and disparity maps. Leveraging the advanced rendering techniques of our customized rendering engine, the dataset is considerably close to the real-world captured images and covers several visual effects, such as brightness changes, light reflection/transmission, lens flare, vivid shadow, etc. We compare the data distribution of IRS with existing stereo datasets to illustrate the typical visual attributes of indoor scenes. In addition, we present a new deep model DispNormNet to simultaneously infer surface normal and disparity from stereo images. Compared to existing models trained on other datasets, DispNormNet trained with IRS produces much better estimation of surface normal and disparity for indoor scenes.

研究の動機と目的

  • 正確な真値不一致および表面法線アノテーションを備えた大規模な屋内ステレオデータセットの不足に対処すること。
  • 反射、影、レンズフレアなどのリアルな視覚効果を再現する、実世界の屋内シーンに類似した合成データセットの開発。
  • 屋内環境におけるステレオ画像から不一致と表面法線を同時に推定するディープラーニングモデルの訓練および評価。
  • 既存のデータセットで訓練されたモデルと比較することで、IRSで訓練したモデルの優位性を示すこと。

提案手法

  • IRSデータセットは、明るさの変動、光の反射、透過、レンズフレア、鮮やかな影を含む複雑な屋内照明効果をシミュレートできるカスタマイズされたレンダリングエンジンを用いて生成された。
  • データセットは100,000枚を超えるステレオRGB画像ペアに加え、正確な不一致および表面法線真値マップを含む。
  • 共通エンコーダーとタスク固有のヘッドを用いて、ステレオ画像から不一致と表面法線を同時に回帰する新しい深層ニューラルネットワーク、DispNormNetが提案された。
  • モデルは、不一致にはL1損失、表面法線には角度損失を組み合わせたマルチタスク損失を用いて、IRSデータセット上でエンドツーエンドで訓練された。
  • 一般化性能を向上させるために、トレーニング中にデータ拡張およびドメインランダマイゼーション技術が適用された。
  • DispNormNetの性能は、標準ベンチマークで評価され、他のデータセットで訓練された既存のモデルと比較された。

実験結果

リサーチクエスチョン

  • RQ1高品質な不一致および表面法線アノテーションを備えた大規模な合成屋内ステレオデータセットは、3次元シーン理解におけるディーパンラーニングモデルの性能向上に寄与するか?
  • RQ2IRSデータセットは、照明効果や素材特性を含む、実際の屋内シーンの視覚的多様性と複雑さをどれほど的確に捉えているか?
  • RQ3統一されたネットワークアーキテクチャを用いた不一致と表面法線の共同推定は、別々の推定ネットワークよりも優れた性能を発揮するか?
  • RQ4既存のステレオデータセットで訓練されたモデルと比較して、IRSで訓練されたモデルの不一致および表面法線の精度は、定量的にどのように優れているか?

主な発見

  • IRSデータセットは、既存のデータセットとのデータ分布比較によって検証されたように、動的照明、反射、影といった現実的な屋内視覚的特徴を的確に捉えている。
  • IRSで訓練されたDispNormNetは、屋内シーンにおける不一致および表面法線推定で最先端の性能を達成した。
  • 他のデータセットで訓練された既存のモデルと比較して、IRSで訓練されたモデルは顕著に優れた性能を示し、正確な幾何的アノテーションを備えた高品質な合成データの価値を裏付けた。
  • DispNormNetの共同予測フレームワークは、別々の推定アプローチと比較して、より一貫性があり正確な幾何的推論を可能にした。
  • 定量的結果では、不一致の平均絶対誤差(MAE)および表面法線の角度誤差が向上したが、正確な数値は論文に記載されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。