Skip to main content
QUICK REVIEW

[論文レビュー] InstanceMotSeg: Real-time Instance Motion Segmentation for Autonomous Driving

Eslam Mohamed, Mahmoud Ewaisha|arXiv (Cornell University)|Aug 16, 2020
Advanced Neural Network Applications参考文献 23被引用数 12
ひとこと要約

本論文では、共有プロトタイプとタスク固有の係数を用いて、モーションとセマンティックインスタンスマスクを同時に予測する、自律走行を想定したリアルタイムのインスタンスモーションセグメンテーションフレームワーク、InstanceMotSegを紹介する。本手法は、KITTIに基づく新しいデータセットを用い、Titan Xpで39 fpsを達成し、ベースラインより10%高いmAPを実現した。

ABSTRACT

Moving object segmentation is a crucial task for autonomous vehicles as it can be used to segment objects in a class agnostic manner based on its motion cues. It will enable the detection of objects unseen during training (e.g., moose or a construction truck) generically based on their motion. Although pixel-wise motion segmentation has been studied in the literature, it is not dealt with at instance level, which would help separate connected segments of moving objects leading to better trajectory planning. In this paper, we proposed a motion-based instance segmentation task and created a new annotated dataset based on KITTI, which will be released publicly. We make use of the YOLACT model to solve the instance motion segmentation network by feeding inflow and image as input and instance motion masks as output. We extend it to a multi-task model that learns semantic and motion instance segmentation in a computationally efficient manner. Our model is based on sharing a prototype generation network between the two tasks and learning separate prototype coefficients per task. To obtain real-time performance, we study different efficient encoders and obtain 39 fps on a Titan Xp GPU using MobileNetV2 with an improvement of 10% mAP relative to the baseline. A video demonstration of our work is available in this https URL.

研究の動機と目的

  • 自律走行におけるインスタンスレベルのモーションセグメンテーションの欠如、特に接続された移動対象物が分離されていない問題に対処する。
  • モス、建設車両など、未学習の移動対象物(例:モス、建設車両)を、単一のモーション特徴に基づいて検出可能にする。
  • 自律システムへの実装を想定し、計算効率の高いモデルを構築し、リアルタイム推論を達成する。
  • ベンチマーク用に、KITTIに基づく新しいインスタンスレベルのモーションアノテーション付きデータセットを構築・公開する。

提案手法

  • YOLACTアーキテクチャを拡張し、共有プロトタイプネットワークを用いて、インスタンスモーションマスクとセマンティックマスクを同時に予測する。
  • タスク固有のプロトタイプ係数を用いて、モーションとセマンティックセグメンテーションヘッドを分離しながら、特徴抽出を共有する。
  • 入力画像と光流(inflow)をネットワークに入力し、インスタンスレベルのセグメンテーションにモーションの手がかりを活用する。
  • リアルタイム推論を達成するため、効率的なエンコーダとしてMobileNetV2を採用し、Titan Xpで39 fpsを実現した。
  • モーションとセマンティックマスク予測を統合したマルチタスク損失関数を用いて、エンドツーエンドでモデルを学習する。
  • 新しいインスタンスレベルのモーションマスクを備えたKITTIに基づくデータセットをアノテートし、本タスクを支援する。

実験結果

リサーチクエスチョン

  • RQ1自律走行シナリオにおいて、接続された移動対象物を分離できるように、モーションベースのインスタンスセグメンテーションを効果的に定式化・学習できるか?
  • RQ2計算コストの増加を最小限に抑えながら、モーションとセマンティックインスタンスセグメンテーションを同時に学習する方法は何か?
  • RQ3どの効率的なバックボーンアーキテクチャが、精度を損なわずリアルタイム性能を達成できるか?
  • RQ4共有プロトタイプを用いた本手法のマルチタスク学習は、ベースラインモデルと比較して一般化性能とmAPをどのように向上させるか?

主な発見

  • MobileNetV2を用いた本手法InstanceMotSegは、Titan Xp GPUで39 fpsの推論速度を達成し、リアルタイム性能を実現した。
  • 新しいインスタンスモーションセグメンテーションベンチマークにおいて、ベースラインのYOLACTモデルと比較してmAPが10%向上した。
  • タスク固有の係数を用いた共有プロトタイプの使用により、顕著な精度低下を伴わず、効率的なマルチタスク学習が可能になった。
  • インスタンスレベルのモーションアノテーションを備えた、KITTIに基づく新しいデータセットを公開し、今後のモーション認識インスタンスセグメンテーション研究を支援する。
  • 本手法は、クラスに依存しない方法で移動対象物をセグメンテーションでき、モーションのみに依存して、以前に学習されていなかった対象クラスの検出が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。