Skip to main content
QUICK REVIEW

[論文レビュー] A Neuromorphic Dataset for Object Segmentation in Indoor Cluttered Environment

Xiaoqian Huang, Kachole Sanket|arXiv (Cornell University)|Feb 13, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

本稿では、ステレオイベントベースカメラを用いた、ごみだらけの屋内環境におけるオブジェクトセグメンテーションのための新規3次元空間時間的ベンチマークであるイベントベースセグメンテーションデータセット(ESD)を紹介する。145のシーケンス(14,166枚のRGBフレーム、21.88M/20.80Mのイベント)を提供し、インスタンスマスクで手動でアノテートされている。RGBイベントデータの統合により高い精度のセグメンテーションが可能となり、クロスモーダルネットワークを用いて既知のオブジェクトでは85.81%のmIoU、未知のオブジェクトでは18.90%のmIoUを達成した。

ABSTRACT

Taking advantage of an event-based camera, the issues of motion blur, low dynamic range and low time sampling of standard cameras can all be addressed. However, there is a lack of event-based datasets dedicated to the benchmarking of segmentation algorithms, especially those that provide depth information which is critical for segmentation in occluded scenes. This paper proposes a new Event-based Segmentation Dataset (ESD), a high-quality 3D spatial and temporal dataset for object segmentation in an indoor cluttered environment. Our proposed dataset ESD comprises 145 sequences with 14,166 RGB frames that are manually annotated with instance masks. Overall 21.88 million and 20.80 million events from two event-based cameras in a stereo-graphic configuration are collected, respectively. To the best of our knowledge, this densely annotated and 3D spatial-temporal event-based segmentation benchmark of tabletop objects is the first of its kind. By releasing ESD, we expect to provide the community with a challenging segmentation benchmark with high quality.

研究の動機と目的

  • 構造的でない屋内環境におけるオブジェクトセグメンテーションのための、高品質で3次元空間時間的で、深度情報およびインスタンスレベルのアノテーションを備えたイベントベースデータセットの不足を解消すること。
  • 遮蔽、運動ブラー、低照度、変動するオブジェクト配置といった困難な条件下でのセグメンテーションアルゴリズムの評価のためのベンチマークを提供すること。
  • イベントカメラとRGBフレームからの補完的データを用いた、ディープラーニングベースのセグメンテーションモデルの開発と比較を可能にすること。
  • 現実のごみだらけの環境における、把持や操作を目的としたロボットビジョンシステムの発展を支援すること。

提案手法

  • 著者らは、ステレオ構成の2台のイベントベースカメラを、RGBカメラと同期させることで、高時間分解能のイベントストリームと対応するフレームを収録した。
  • 合計145のシーケンスが記録され、線形運動、回転運動、線形-回転運動の組み合わせといった多様なカメラの動き、照度条件、遮蔽を含むオブジェクト配置がカバーされた。
  • すべての14,166枚のRGBフレームに対して手動でインスタンスセグメンテーションマスクが作成され、2台のカメラからの21.88Mおよび20.80Mのイベントに対して、密なピクセル単位のアノテーションが提供された。
  • RGBD設定からの深度情報がデータセットに含まれており、遮蔽シーンにおけるセグメンテーションに不可欠な3次元空間的理解を可能にしている。
  • RGBとイベントデータを統合した状態で、2つのクロスモーダルセグメンテーションモデル(SA-GATEとCMX)を訓練・評価し、さまざまな条件下での性能を評価した。
  • イベントデータは、独自のMATLABツールを用いて自動でラベル付けされ、アノテーションの一貫性とスケーラビリティが確保された。
Figure 1 : Hardware setup. Experimental hardware setup (left-side figure): three cameras are fixed on the end-effector of the UR10’s manipulator. Camera configuration (right-side figure): The RGBD camera Intel D435 is placed in the middle, and two event-based cameras Davis 346c are mounted on the le
Figure 1 : Hardware setup. Experimental hardware setup (left-side figure): three cameras are fixed on the end-effector of the UR10’s manipulator. Camera configuration (right-side figure): The RGBD camera Intel D435 is placed in the middle, and two event-based cameras Davis 346c are mounted on the le

実験結果

リサーチクエスチョン

  • RQ1RGBとイベントデータの統合は、RGBオンリーモードに比べて、ごみだらけの屋内環境におけるインスタンスセグメンテーションの精度をどのように向上させるか?
  • RQ2イベントベースデータで学習したモデルの未知オブジェクトに対するセグメンテーション性能はどの程度で、既知オブジェクトのセグメンテーションと比べてどうなるか?
  • RQ3カメラの運動タイプ(線形、回転、組み合わせ)の違いが、イベントベースビジョンにおけるセグメンテーション精度に与える影響は何か?
  • RQ4従来のRGBカメラに比べて、イベントベースデータは運動ブラーおよび低照度による劣化をどの程度軽減するか?
  • RQ5オブジェクト数や遮蔽レベルの変化が、イベントベースおよびRGBオンリーモードにおけるセグメンテーション性能に与える影響は?

主な発見

  • CMXモデルは、RGBとイベントデータを統合した場合、既知のオブジェクトで85.81%のmIoUを達成し、RGBオンリーベースラインを顕著に上回った。
  • 未知のオブジェクトでは、mIoUが18.90%に低下し、イベントデータを用いたゼロショットセグメンテーションにおける大きな課題を示した。
  • CMXを用いた場合、回転運動時と線形運動時で、それぞれ3.77%および4.42%の精度向上が見られ、エッジ情報の豊かさが要因であった。
  • 低照度条件下では、RGBオンリーメソッドのmIoUは50%未満に低下したが、イベントベース統合ではmIoUが約85%を維持した。これにより、照度変化に対するロバストネスが示された。
  • カメラとテーブルの距離が62–82 cmの範囲で変化しても、CMXモデルはDeepLabV3に0.67%の性能優位を維持したが、全体の精度に与える影響は最小であった。
  • 複数オブジェクトの状況ではU字型のmIoUトレンドが観察され、6つのオブジェクトで完全なスタッキングが生じた際の性能が最低となった。これは、密な遮蔽の困難さを示している。
(a)
(a)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。