Skip to main content
QUICK REVIEW

[論文レビュー] Distantly Supervised Road Segmentation

Satoshi Tsutsui, Tommi Kerola|arXiv (Cornell University)|Aug 21, 2017
Automated Road and Building Extraction参考文献 28被引用数 5
ひとこと要約

本稿では、ピクセル単位のアノテーションに代わる画像レベルのラベルのみを用いて、完全畳み込みニューラルネットワーク(FCN)を訓練する、遠隔監視型の道路セグメンテーション手法を提案する。ImageNet や Places といった一般画像データベースからのサリエンシー・マップとスーパーピクセルを組み合わせることで、反復的な FCN 訓練に適した弱いピクセル単位のマスクを生成する。この手法により、完全監視学習モデルの 93.8% の性能を達成しつつ、アノテーション作業のコストを桁違いに削減できる。

ABSTRACT

We present an approach for road segmentation that only requires image-level annotations at training time. We leverage distant supervision, which allows us to train our model using images that are different from the target domain. Using large publicly available image databases as distant supervisors, we develop a simple method to automatically generate weak pixel-wise road masks. These are used to iteratively train a fully convolutional neural network, which produces our final segmentation model. We evaluate our method on the Cityscapes dataset, where we compare it with a fully supervised approach. Further, we discuss the trade-off between annotation cost and performance. Overall, our distantly supervised approach achieves 93.8% of the performance of the fully supervised approach, while using orders of magnitude less annotation work.

研究の動機と目的

  • 自動運転システムにおけるピクセル単位の道路セグメンテーションの高コストなアノテーションを低減すること。
  • 自動車中心の画像におけるピクセル単位のアノテーションを一切必要としない、完全畳み込みニューラルネットワーク(FCN)の道路セグメンテーションの訓練を可能にすること。
  • 弱い監視学習におけるアノテーションコストとセグメンテーション性能のトレードオフを調査すること。
  • 外部画像データベースを弱い監視として用いた遠隔監視学習の実現可能性と有効性を評価すること。
  • 弱い監視学習による訓練が、ピクセル単位のラベルをわずかに用いても、ほぼ完全監視学習の性能に達成できることを示すこと。

提案手法

  • ImageNet や Places からの画像レベルのラベルを用いて、自動車中心の道路画像とは異なる一般画像に対してサリエンシー検出器を学習する。
  • 事前学習済みモデルから得たサリエンシー・マップを自動車中心の画像に適用し、弱くノイズの多いピクセル単位の道路マスクを生成する。
  • 自動車中心の画像からスーパーピクセルを抽出することで、生成されたマスクの空間的整合性を向上させる。
  • 弱いマスクを反復的に用いて FCN を道路セグメンテーション用に訓練し、自己学習により性能を向上させる。
  • このアプローチは FCN のアーキテクチャに変更を加える必要がなく、標準的な訓練パイプラインと互換性がある。
  • 一部の真値ピクセル単位のアノテーションを用いたファインチューニングにより、性能が向上し、完全監視学習の mIOU の 96.5% を達成した。

実験結果

リサーチクエスチョン

  • RQ1遠隔監視学習を用いて、画像レベルのラベルのみで高精度な道路セグメンテーションを達成できるか?
  • RQ2Cityscapes データセットにおいて、弱い監視学習による FCN の性能は、完全監視学習のベースラインと比べてどの程度か?
  • RQ3弱い監視学習における道路セグメンテーションのアノテーションコストとセグメンテーション精度のトレードオフは何か?
  • RQ4一般画像データベースからのサリエンシー・マップを自動車中心の道路セグメンテーションに効果的に転送できるか?
  • RQ5弱い監視マスクを用いた反復的訓練が、最終的なセグメンテーション精度を向上させるか?

主な発見

  • 遠隔監視型の手法は、Cityscapes データセットにおいて完全監視学習ベースラインの mIOU の 93.8% を達成した。
  • 弱いマスクを用いた訓練によりセグメンテーション性能が向上し、自己学習を複数回繰り返した後、mIOU が 0.80 に上昇した。
  • 真値ピクセル単位のアノテーションの 60% のみを用いたファインチューニングにより、mIOU が 0.855 に達し、完全監視学習モデルとほぼ同等の性能を達成した。
  • すべての真値アノテーションを用いてファインチューニングした最終モデルは、mIOU が 0.863 に達し、完全監視学習ベースラインを上回った。
  • アノテーションコストは完全監視学習ベースラインの 1% 未満にまで削減され、およそ 0.6 時間(完全監視学習は 65.3 時間)と推定された。
  • 外部データベースからの弱い監視が、道路セグメンテーションにおける高コストなピクセル単位のアノテーションを効果的に代替できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。