Skip to main content
QUICK REVIEW

[論文レビュー] Unbiasing Semantic Segmentation For Robot Perception using Synthetic Data Feature Transfer

Jonathan Balloch, Varun Agrawal|arXiv (Cornell University)|Sep 11, 2018
Advanced Neural Network Applications参考文献 40被引用数 12
ひとこと要約

本論文では、ロボットビジョンのためのリアルタイム意味セグメンテーションモデルを、合成セグメンテーションデータで事前学習することで、ImageNet事前学習よりも顕著に性能向上を達成する手法を提案する。多様でバイアスの少ない合成データからの特徴転送により、実世界の微調整データが限られる状況でも、優れた精度を達成でき、特に実データが不足している状況で顕著な効果を示す。

ABSTRACT

Robot perception systems need to perform reliable image segmentation in real-time on noisy, raw perception data. State-of-the-art segmentation approaches use large CNN models and carefully constructed datasets; however, these models focus on accuracy at the cost of real-time inference. Furthermore, the standard semantic segmentation datasets are not large enough for training CNNs without augmentation and are not representative of noisy, uncurated robot perception data. We propose improving the performance of real-time segmentation frameworks on robot perception data by transferring features learned from synthetic segmentation data. We show that pretraining real-time segmentation architectures with synthetic segmentation data instead of ImageNet improves fine-tuning performance by reducing the bias learned in pretraining and closing the extit{transfer gap} as a result. Our experiments show that our real-time robot perception models pretrained on synthetic data outperform those pretrained on ImageNet for every scale of fine-tuning data examined. Moreover, the degree to which synthetic pretraining outperforms ImageNet pretraining increases as the availability of robot data decreases, making our approach attractive for robotics domains where dataset collection is hard and/or expensive.

研究の動機と目的

  • 限られたノイズの多い実世界データでのロボットビジョンのためのリアルタイム意味セグメンテーションモデルの学習という課題に対処すること。
  • 低リソースなロボットビジョンの状況において、ImageNet事前学習が引き起こすバイアスと分布シフトを克服すること。
  • 合成データによる事前学習が、ImageNet事前学習と比較して、合成データと実データの間のドメインギャップをより効果的に埋め合わせられるかどうかを調査すること。
  • さまざまな量の実世界微調整データを用いた場合の、合成事前学習による性能向上を定量的に評価すること。
  • 合成事前学習の有効性において、ハイレベルなドメイン類似性と、データの多様性、スケール、バイアスの影響を評価すること。

提案手法

  • ImageNetの代わりに、大規模な合成RGB-Dセグメンテーションデータセット(例:SceneNet RGB-D、GTA)を用いて、リアルタイムセグメンテーションアーキテクチャ(例:DeepLabv3+ with MobileNet)を事前学習する。
  • 段階的に小さいラベル付きデータのサブセットを用いて、実ロボットビジョンデータセット(例:Cityscapes、SUN RGB-D、Robot@Home)で事前学習モデルを微調整する。
  • 主な指標としてmIoU(平均交差率)を用いて、ImageNetで事前学習したモデルと性能を比較する。
  • 高レベルのドメイン類似性の影響を分離するために、類似した(例:GTAはドライブ用)と類似しない(例:SceneNetは屋内ナビゲーション用)合成データセットでの事前学習を比較するアブレーションスタディを実施する。
  • 転移学習を用いて、合成データと実データの間のドメインシフトギャップ(G^{tr})が、合成事前学習によってどの程度軽減されるかを評価する。
  • 異なる合成データ分布で学習したモデルを比較することで、合成事前学習におけるデータの多様性、スケール、ドメイン類似性のトレードオフを分析する。

実験結果

リサーチクエスチョン

  • RQ1ImageNet事前学習と比較して、合成データで事前学習したリアルタイムセグメンテーションモデルは、実ロボットビジョンデータでの微調整性能を向上させるか?
  • RQ2合成事前学習による性能向上は、実世界の微調整データ量が減少するに従ってどのように変化するか?
  • RQ3合成事前学習データと実ターゲットデータのハイレベルなドメイン類似性が、モデル性能にどの程度影響を及えるか?
  • RQ4合成事前学習の利点は、ドメイン類似性に起因するのか、それともデータの多様性、スケール、バイアス低減といった他の要因に起因するのか?
  • RQ5合成事前学習は、ロボットアプリケーションにおける強力なセグメンテーション性能を達成するために必要な実世界データ量を削減できるか?

主な発見

  • 合成データで事前学習したモデルは、すべての微調整データスケールでImageNet事前学習モデルを上回り、実データが限られるほど性能向上が顕著になる。
  • 合成事前学習により、ImageNet事前学習と比較して実データの必要量が15%~50%削減され、顕著に少ないラベル付きデータでImageNetベースの性能に達することができる。
  • たとえスケールが小さくても、25KフレームのSceneNet RGB-DやGTAで事前学習したモデルは、CityscapesやSUN RGB-Dの両方でImageNet事前学習を上回る性能を示しており、スケールにかかわらず合成データの有効性が裏付けられている。
  • 入力の多様性が高くバイアスが低い合成データで事前学習したモデルは、ターゲットタスクに対して代表的でないが、ハイレベルなドメインが類似したデータで事前学習したモデルを上回る性能を発揮する。
  • 事前学習データとターゲットデータのハイレベルな類似性は一部の性能向上に寄与するが、ドメイン類似性だけでは不十分で、データの多様性とバイアス低減が成功の予測要因としてより強く寄与している。
  • 実データの可用性が低下するに従い、ImageNetと合成事前学習の性能差が拡大するため、合成事前学習がデータが不足するロボットアプリケーションにスケーラブルなソリューションであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。