[論文レビュー] IRS: A Large Naturalistic Indoor Robotics Stereo Dataset to Train Deep Models for Disparity and Surface Normal Estimation
本稿では、100,000枚を超えるステレオRGB画像に加え、高精度な視差および表面法線の教師強化データを備えた大規模な合成屋内ステレオデータセットIRSを紹介する。このデータセットは、リアルな視覚効果を再現するためのカスタマイズされたUnreal Engine 4パイプラインを用いて生成されたものである。IRSで訓練された2段階のDTN-Netモデルは、表面法線推定において最先端の性能を達成し、合成データおよび実世界のベンチマークの両方で既存手法を上回っている。
Indoor robotics localization, navigation, and interaction heavily rely on scene understanding and reconstruction. Compared to the monocular vision which usually does not explicitly introduce any geometrical constraint, stereo vision-based schemes are more promising and robust to produce accurate geometrical information, such as surface normal and depth/disparity. Besides, deep learning models trained with large-scale datasets have shown their superior performance in many stereo vision tasks. However, existing stereo datasets rarely contain the high-quality surface normal and disparity ground truth, which hardly satisfies the demand of training a prospective deep model for indoor scenes. To this end, we introduce a large-scale synthetic but naturalistic indoor robotics stereo (IRS) dataset with over 100K stereo RGB images and high-quality surface normal and disparity maps. Leveraging the advanced rendering techniques of our customized rendering engine, the dataset is considerably close to the real-world captured images and covers several visual effects, such as brightness changes, light reflection/transmission, lens flare, vivid shadow, etc. We compare the data distribution of IRS with existing stereo datasets to illustrate the typical visual attributes of indoor scenes. Besides, we present DTN-Net, a two-stage deep model for surface normal estimation. Extensive experiments show the advantages and effectiveness of IRS in training deep models for disparity estimation, and DTN-Net provides state-of-the-art results for normal estimation compared to existing methods.
研究の動機と目的
- 屋内ロボティクスアプリケーション向けに、高品質で大規模なステレオデータセットに、密集した視差および表面法線アノテーションが不足している問題を解決する。
- 露出のばらつき、光の反射・透過、レンズフレア、鮮やかな影といったリアルな視覚的特徴を欠いた既存の合成データセットの限界を克服する。
- IRSで訓練されたディープラーニングフレームワークを開発し、実世界の屋内シーンにおける視差および表面法線推定の一般化性能と精度を向上させる。
- 飛行物体3D(FlyingThings3D)のような既存の合成データセットと比較して、IRSで訓練されたモデルが、複雑な実世界の視覚的効果に対しても一般化性能が優れていることを実証する。
提案手法
- 高度なレンダリング技術を用いたカスタマイズされたUnreal Engine 4レンダリングパイプラインを用いて、大規模な屋内ステレオデータセット(IRS)を生成する。
- 明るさのばらつき、光の反射/透過、レンズフレア、鮮やかな影といったリアルな視覚効果を統合し、リアルさを向上させる。
- 100,000組を超えるステレオRGB画像に加え、密集した教師強化視差マップおよび表面法線マップを収集する。
- まず視差を予測し、その後に予測された視差マップを用いて表面法線を精緻化する2段階の深層ニューラルネットワークであるDTN-Netを設計する。
- IRS上でモデルを訓練し、MiddleburyおよびKITTIなどの実世界データセットと比較して一般化性能と精度を評価する。
- データ拡張およびドメイン適応技術を用いて、実世界の視覚的変動に強いモデルの耐性を向上させる。
実験結果
リサーチクエスチョン
- RQ1リアルな視覚的特徴を備えた合成ステレオデータセットが、実際の屋内シーンにおける視差および表面法線推定のディープラーニングモデルの一般化性能を向上させることができるか?
- RQ2明るさ、照明、光学的効果の観点から、FlyingThings3Dなどの既存の合成データセットと比較して、IRSの視覚的リアリズムはどの程度優れているか?
- RQ3他の合成データセットと比較して、IRSで訓練したモデルは実世界のステレオベンチマークでどの程度性能が向上するか?
- RQ4予測された視差を活用して表面法線を精緻化する2段階のディープラーニングモデル(DTN-Net)は、従来のRGBのみまたは深度統合モデルを上回ることができるか?
- RQ5訓練データにレンズフレアや反射などのリアルな視覚的アーティファクトが含まれることで、困難な実世界のシーンにおける予測の頑健性が向上するか?
主な発見
- FADNet(IRS)のようにIRSで訓練されたモデルは、Middleburyデータセットにおいて平均エンドツーエンド誤差が1.86と著しく低く、FADNet(FT3D)の2.68と比較して一般化性能に優れていることが示された。
- DTN-NetはIRSデータセット上で平均角度誤差10.64°を達成し、NormNetS(13.93°)およびDFN-Net(12.81°)を上回り、74.1%の画素が11.25°未満の誤差を示した。
- Intel RealSense D435iで撮影された実世界の画像においても、IRSで訓練されたDTN-NetおよびFADNetは、反射面やテクスチャが複雑な表面に対しても一貫性があり正確な表面法線および視差マップを生成した。
- 定性的な結果から、IRSで訓練されたモデルは、FlyingThings3Dで訓練されたモデルと比較して、レンズフレアやミラー反射といった挑戦的な視覚的効果をより頑健に処理していることが明らかになった。
- IRSにおけるリアルなレンダリングと高品質な教師強化データの組み合わせにより、既存のデータセットと比較して合成および実世界のベンチマークの両方で優れた性能が得られた。
- 視差を用いて法線を精緻化する2段階のDTN-Netアーキテクチャは、最先端の結果を達成し、幾何的制約をディープラーニングモデルに統合することの価値を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。