Skip to main content
QUICK REVIEW

[論文レビュー] Compressing Sensor Data for Remote Assistance of Autonomous Vehicles using Deep Generative Models

Daniel Bogdoll, Johannes Jestram|arXiv (Cornell University)|Nov 4, 2021
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、効率的なリモートアシスタンスを可能にするために、自律走行車両のセンサデータ用に深層生成モデルに基づく圧縮パイプラインを提案する。VAEを用いたリアルタイムの画像およびLiDAR圧縮と、高品質な再構成を実現するGANを組み合わせることで、ROS統合型オンラインパイプラインとして、圧縮効率、再構成忠実度、低レイテンシーのバランスを実現した。VAEは、より速い推論性能を示し、リアルタイムのリモートアシスタンスにおいて最も実用的であることが判明した。

ABSTRACT

In the foreseeable future, autonomous vehicles will require human assistance in situations they can not resolve on their own. In such scenarios, remote assistance from a human can provide the required input for the vehicle to continue its operation. Typical sensors used in autonomous vehicles include camera and lidar sensors. Due to the massive volume of sensor data that must be sent in real-time, highly efficient data compression is elementary to prevent an overload of network infrastructure. Sensor data compression using deep generative neural networks has been shown to outperform traditional compression approaches for both image and lidar data, regarding compression rate as well as reconstruction quality. However, there is a lack of research about the performance of generative-neural-network-based compression algorithms for remote assistance. In order to gain insights into the feasibility of deep generative models for usage in remote assistance, we evaluate state-of-the-art algorithms regarding their applicability and identify potential weaknesses. Further, we implement an online pipeline for processing sensor data and demonstrate its performance for remote assistance using the CARLA simulator.

研究の動機と目的

  • ネットワークインfraの過負荷を避けるために、高容量の自律走行車両センサデータ(カメラおよびLiDAR)をリアルタイムで送信する課題に対処する。
  • リモートアシスタンスの文脈において、画像およびLiDAR圧縮の分野で最新の深層生成モデル(VAEおよびGAN)を従来のコーデック(例:JPEG、MPEG)と比較して評価する。
  • カメラおよびLiDARデータを一度の推論パスで処理可能な、統合的でオンラインなROSベースの圧縮パイプラインを設計および実装する。
  • リモートアシスタンス用途における、圧縮レート、再構成品質、認識能力(物体検出)、処理レイテンシーのトレードオフを評価する。
  • 特にGANベースのモデルにおいて顕在化する、リアルタイムデプロイにおける実用的制約および性能ボトルネックを同定する。

提案手法

  • KITTIおよびWAYMO Perception Open Datasetを用いて、画像およびLiDAR圧縮のためのVAEベースおよびGANベースのオートエンコーダーを訓練および評価した。
  • ロボットオペレーティングシステム(ROS)に統合されたエンドツーエンドのオンライン圧縮パイプラインを実装し、センサデータのリアルタイム処理と送信を可能にした。
  • カメラ画像およびLiDARポイントクラウドの両方を圧縮するための共有エンコーダ・デコーダアーキテクチャを採用し、一度の推論パスで統合処理を実現した。
  • 生のLiDARポイントクラウドを、深層生成モデルへの入力に適したテンソル形式に変換し、計算オーバーヘッドを低減するためのカスタム前処理を実施した。
  • 前処理、圧縮、復元の各段階におけるレイテンシーを測定・分析し、性能ボトルネックを同定した。
  • 再構成品質はPSNR、SSIM、LPIPS指標を用いて評価し、再構成画像上の物体検出による認識能力の評価も実施した。

実験結果

リサーチクエスチョン

  • RQ1VAEおよびGANは、自律走行車両の画像圧縮において、従来のコーデック(例:JPEG、MPEG)と比較して、レート・ディストーション特性および認識品質の面でどのように異なるか?
  • RQ2低ビットレート圧縮(例:0.2–0.3 bpp)が、リモートアシスタンス用途における再構成画像上の物体検出性能に与える影響は何か?
  • RQ3画像およびLiDARデータのための生成モデルにおけるリアルタイム処理レイテンシーはどの程度か?また、主な性能ボトルネックとなるコンponentは何か?
  • RQ4統合型の深層生成モデルパイプラインは、リモートアシスタンス用途において、最小限のレイテンシーでカメラおよびLiDARデータを効率的に圧縮できるか?
  • RQ5LiDARポイントクラウドの前処理は、全体のパイプラインレイテンシーにどのように影響するか?最適化された変換手法はリアルタイム性能を向上させられるか?

主な発見

  • GANベースの画像圧縮は、低ビットレート(0.2–0.3 bpp)でも最高の再構成品質を達成し、PSNRおよびSSIM値から高い忠実度を示した。また、リモートアシスタンス用途に十分な物体検出精度を維持した。
  • VAEベースの画像圧縮は、速度と品質のバランスに優れており、GAN(54.7 ms)に比べて顕著に低いレイテンシー(圧縮時12.3 ms)を実現した。このため、リアルタイムのリモートアシスタンスに適している。
  • VAEを用いたLiDAR圧縮では、元のポイントクラウドと再構成されたポイントクラウドとの間で平均ユークリッド距離誤差が0.3–0.5 mに達し、顕著な幾何的歪みが生じた。
  • LiDARデータの前処理(テンソル形式への変換)が主なボトルネックであり、1スキャンあたり114.5 msを要し、圧縮(10.4 ms)および復元(8.9 ms)の時間よりも著しく長かった。
  • 高い圧縮レートを達成したが、GANの推論レイテンシーが高いため、リアルタイム用途には不適切であり、実用的なリモートアシスタンスシステムでは除外された。
  • ROS統合型オンラインパイプラインは、カメラおよびLiDARデータのエンドツーエンド処理を一度のパスで実現し、統合圧縮アーキテクチャの実現可能性を検証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。