Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Segmentation for Autonomous Driving: Model Evaluation, Dataset Generation, Perspective Comparison, and Real-Time Capability

Senay Cakir, Marcel Gauß|arXiv (Cornell University)|Jul 26, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、合成画像と実画像を組み合わせたハイブリッドデータセットを用いて、自律走行ドライビングにおけるリアルタイム意味セグメンテーションのためのFasterSegを評価している。合成ラベル付きデータの半自動的生成パイプラインを導入し、フロントビューとオールドビューの視点を比較した。FasterSegはNVIDIA Jetson AGX Xavier上で247.11 FPS、mIoU 65.44%を達成した。FP16推論ではフレームレートが2倍になり、精度に影響を及げないことが示された。

ABSTRACT

Environmental perception is an important aspect within the field of autonomous vehicles that provides crucial information about the driving domain, including but not limited to identifying clear driving areas and surrounding obstacles. Semantic segmentation is a widely used perception method for self-driving cars that associates each pixel of an image with a predefined class. In this context, several segmentation models are evaluated regarding accuracy and efficiency. Experimental results on the generated dataset confirm that the segmentation model FasterSeg is fast enough to be used in realtime on lowpower computational (embedded) devices in self-driving cars. A simple method is also introduced to generate synthetic training data for the model. Moreover, the accuracy of the first-person perspective and the bird's eye view perspective are compared. For a $320 imes 256$ input in the first-person perspective, FasterSeg achieves $65.44\,\%$ mean Intersection over Union (mIoU), and for a $320 imes 256$ input from the bird's eye view perspective, FasterSeg achieves $64.08\,\%$ mIoU. Both perspectives achieve a frame rate of $247.11$ Frames per Second (FPS) on the NVIDIA Jetson AGX Xavier. Lastly, the frame rate and the accuracy with respect to the arithmetic 16-bit Floating Point (FP16) and 32-bit Floating Point (FP32) of both perspectives are measured and compared on the target hardware.

研究の動機と目的

  • 自律走行RC車両における低消費電力埋め込みシステムに適した高速かつ高精度な意味セグメンテーションモデルの特定。
  • 手動アノテーションの負荷を低減しつつ、モデル性能を維持できるスケーラブルで半自動のラベル付き合成学習データ生成手法の開発。
  • 自律走行の意味セグメンテーションにおいて、フロントビューとオールドビューの視点の性能を比較すること。
  • リアルタイムデプロイメントにおけるFP16とFP32の算術演算が、推論速度と精度に与える影響を評価すること。

提案手法

  • カスタマイズ可能なレーン生成機能を備えた、Gazeboベースのシミュレーション環境を用いて、オブジェクト配置と自動アノテーションを可能にする合成ドライブシーンを生成した。
  • 公開データセットからの手動アノテーション済み実画像を少量使用し、シミュレーションから得た合成画像と組み合わせてハイブリッド学習データセットを作成した。
  • FasterSegモデルを、ハイブリッドデータセットを用いてフロントビューとオールドビューの両方の視点で学習および評価した。
  • 幾何変換と深度推定を用いて、フロントビュー画像をオールドビュー表現に変換するためのデータ拡張パイプラインを構築した。
  • NVIDIA Jetson AGX Xavier上でFP16とFP32の両方の精度を使用してモデル推論をベンチマークし、リアルタイム性能と精度のトレードオフを評価した。
  • 評価指標にはmIoU、クラス別IoU、およびフレームレート(FPS)を用い、複数の入力解像度およびデータソースで結果を報告した。

実験結果

リサーチクエスチョン

  • RQ1自律走行RC車両の低消費電力埋め込みハードウェアにリアルタイムデプロイメント可能な、高速かつ高精度な画像セグメンテーションモデルは何か?
  • RQ2手動アノテーションの負荷を最小限に抑えつつ、モデル性能を維持できる、効率的なラベル付き合成学習データの生成方法は何か?
  • RQ3自律走行タスクにおける意味セグメンテーション精度の観点から、オールドビュー視点はフロントビュー視点を上回るか?
  • RQ4リアルタイムアプリケーションにおいて、16ビットと32ビットの浮動小数点算術演算を用いることで、モデル精度と推論速度にどのような影響を与えるか?

主な発見

  • FasterSegは、NVIDIA Jetson AGX Xavier上で320×256解像度のフロントビュー入力に対して247.11 FPS、mIoU 65.44%を達成した。
  • 同じ解像度でオールドビュー視点はmIoU 64.08%を達成し、フロントビューと同等の性能であることが示された。
  • FP16推論ではFP32に比べて約2倍のフレームレートが得られ(例:256×256解像度のオールドビューで319.85 FPS 対 190.91 FPS)、精度に顕著な差は認められなかった。
  • 算術精度(FP16 対 FP32)はmIoUに統計的に有意な影響を及げず、全テスト設定において差が0.03%未満であった。
  • 半自動の合成データ生成パイプラインは、ラベル付け作業の負荷を著しく低減しつつ、多様なシミュレート環境でのモデル学習を可能にした。
  • モデルは高解像度入力(例:2048×1536)に対しても高い精度を維持しており、フロントビューで55.80%のmIoUを達成したが、フレームレートは著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。