Skip to main content
QUICK REVIEW

[論文レビュー] MVTrans: Multi-View Perception of Transparent Objects

Yi Ru Wang, Yuchi Zhao|arXiv (Cornell University)|Feb 22, 2023
Advanced Vision and Imaging被引用数 6
ひとこと要約

MVTransは、RGB、ステレオ、マルチビュー入力を統合して深度、セグメンテーション、ポーズ、3Dバウンディングボックスを同時に予測するエンドツーエンドのマルチビュー深層学習フレームワークを提案する。リアルおよび合成データセットの両方で最先端のRGB-Dおよびステレオ手法を上回り、独自のフォトリアリスティックなデータセット「Syn-TODD」のおかげで、複雑なシーンや多様な透明物体に対して堅牢な学習と一般化が可能となる。

ABSTRACT

Transparent object perception is a crucial skill for applications such as robot manipulation in household and laboratory settings. Existing methods utilize RGB-D or stereo inputs to handle a subset of perception tasks including depth and pose estimation. However, transparent object perception remains to be an open problem. In this paper, we forgo the unreliable depth map from RGB-D sensors and extend the stereo based method. Our proposed method, MVTrans, is an end-to-end multi-view architecture with multiple perception capabilities, including depth estimation, segmentation, and pose estimation. Additionally, we establish a novel procedural photo-realistic dataset generation pipeline and create a large-scale transparent object detection dataset, Syn-TODD, which is suitable for training networks with all three modalities, RGB-D, stereo and multi-view RGB. Project Site: https://ac-rad.github.io/MVTrans/

研究の動機と目的

  • ロボット工学や自動化分野における透明物体認識の持続的課題に取り組むこと。標準的なRGB-Dセンサは非ラムベールト性および透明な表面特性のため、機能しないためである。
  • 既存のRGB-Dおよびステレオベースの手法の限界を克服するため、深度推定、セグメンテーション、3Dシーン理解を統合するエンドツーエンドのマルチビューアーキテクチャを開発すること。
  • RGB、RGB-D、ステレオ、マルチビューの複数モodalitiyに対応した豊富なアノテーションを備えた大規模でフォトリアリスティックかつ多様な合成データセット(Syn-TODD)を構築すること。
  • マルチビュー認識が、特に複雑で遮蔽され、ごみだらけのシーンにおいて、ステレオや単一ビュー手法よりも顕著に性能向上を実現することを実証すること。

提案手法

  • MVTransは、複数のRGB画像を入力とし、透明および不透明な物体のセグメンテーションマスク、深度マップ、3Dバウンディングボックス、オブジェクトポーズを同時に予測するマルチタスクでエンドツーエンドの深層ニューラルネットワークを採用する。
  • マルチビュー幾何と複数の視点間での特徴統合を活用して3D認識を強化し、市販のRGB-Dセンサからの信頼性の低い深度マップへの依存を低減する。
  • 透明な物体に現実的な材料特性とシーンの変動を備えた、プロシージャルなフォトリアリスティックなデータセット生成パイプラインを新規に導入する。
  • 1,996のフォトリアリスティックなテーブルトップシーンから構成され、1シーンあたり57枚の完全にアノテートされたビューを持つ大規模なデータセット「Syn-TODD」を構築し、複数のモダリティでの学習と評価を支援する。
  • セグメンテーション、深度、3D検出/ポーズの各タスクに特化したヘッドを備えた共有バックボーンを採用することで、複数の認識タスク間での共同最適化を可能にする。
  • データセット作成段階でドメインランダム化とプロシージャルなシーン生成を活用し、モデルの一般化性能とシミュレーションから現実への転送性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1マルチビュー学習フレームワークは、深度推定、セグメンテーション、3Dポーズ予測といった透明物体認識タスクにおいて、ステレオおよびRGB-Dベースの手法を上回ることができるか?
  • RQ2複雑で遮蔽され、ごみだらけのシーンに複数の透明物体が存在する状況において、入力ビュー数を増やすと性能にどのような影響を与えるか?
  • RQ3大規模でフォトリアリスティックな合成データセット(Syn-TODD)は、マルチビュー透明物体認識モデルの一般化性能と耐障害性をどの程度向上できるか?
  • RQ4エンドツーエンドのマルチタスク学習アプローチは、逐次的またはマルチステージのパイプラインよりも優れた性能を発揮するか?

主な発見

  • MVTransは、リアルワールド(KeyPose)および合成データセット(Syn-TODD)の両方で、深度推定、セグメンテーション、3Dポーズ予測のすべての認識タスクにおいて、最先端のRGB-Dおよびステレオベースのモデルを上回る性能を達成した。
  • 5ビュー版のMVTransが最高の性能を示し、2ビューおよびステレオベースラインと比較して、特に複数の透明物体が存在する複雑なシーンで顕著な向上を示した。
  • Syn-TODDデータセット上では、3DバウンディングボックスのAPが58.7%、ポーズ推定のAPが62.1%を達成し、挑戦的で多様かつ複雑なシーンにおいて強力な性能を示した。
  • アブレーションスタディの結果、ビュー数の増加が性能向上に寄与することが確認された。特に3Dタスク(3Dバウンディングボックス推定)では顕著な向上が見られたが、2Dセグメンテーションは元々2D特性を有するため、わずかな向上にとどまった。
  • Syn-TODDで学習したMVTransは、リアルワールドデータに良好に一般化され、KeyPoseのようなリアルワールドデータセットで学習したモデルを上回った。これは、合成データパイプラインの有効性を示している。
  • 提案されたSyn-TODDデータセットは、既存のデータセットと比較して、はるかに高いシーンの複雑さ、オブジェクトの多様性、アノテーションの豊かさを備えており、より堅牢なモデルの学習と評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。