Skip to main content
QUICK REVIEW

[論文レビュー] GAN- vs. JPEG2000 Image Compression for Distributed Automotive Perception: Higher Peak SNR Does Not Mean Better Semantic Segmentation

Jonas Löhdefink, Andreas Bär|arXiv (Cornell University)|Feb 12, 2019
Image and Signal Denoising Methods被引用数 11
ひとこと要約

この論文は、分散自動車認識を想定した文脈において、GANベースの画像圧縮をJPEG2000および標準コーデックと比較して評価しており、PSNRが低いにもかかわらず、GAN圧縮は顕著に優れた意味的セグメンテーションmIoUを達成している。特に、セグメンテーションモデルをGAN再構成画像でファインチューニングした場合、元の画像で訓練したモデルに比べてmIoUが16.6%上昇する。0.0625ビット/ピクセルのレートでは、mIoUが最大で3.9%絶対値で向上し、これは自動車認識システムに不可欠である。

ABSTRACT

The high amount of sensors required for autonomous driving poses enormous challenges on the capacity of automotive bus systems. There is a need to understand tradeoffs between bitrate and perception performance. In this paper, we compare the image compression standards JPEG, JPEG2000, and WebP to a modern encoder/decoder image compression approach based on generative adversarial networks (GANs). We evaluate both the pure compression performance using typical metrics such as peak signal-to-noise ratio (PSNR), structural similarity (SSIM) and others, but also the performance of a subsequent perception function, namely a semantic segmentation (characterized by the mean intersection over union (mIoU) measure). Not surprisingly, for all investigated compression methods, a higher bitrate means better results in all investigated quality metrics. Interestingly, however, we show that the semantic segmentation mIoU of the GAN autoencoder in the highly relevant low-bitrate regime (at 0.0625 bit/pixel) is better by 3.9% absolute than JPEG2000, although the latter still is considerably better in terms of PSNR (5.91 dB difference). This effect can greatly be enlarged by training the semantic segmentation model with images originating from the decoder, so that the mIoU using the segmentation model trained by GAN reconstructions exceeds the use of the model trained with original images by almost 20% absolute. We conclude that distributed perception in future autonomous driving will most probably not provide a solution to the automotive bus capacity bottleneck by using standard compression schemes such as JPEG2000, but requires modern coding approaches, with the GAN encoder/decoder method being a promising candidate.

研究の動機と目的

  • 分散認識システムにおける自動車画像圧縮のビットレートと認識性能のトレードオフを評価すること。
  • 意味的セグメンテーションの文脈において、従来のコーデック(JPEG、JPEG2000、WebP)とGANベースのオートエンコーダーを比較すること。
  • PSNR や SSIM といった歪み指標が、下流の認識性能を信頼性を持って予測できるかどうかを調査すること。
  • 元の画像ではなく、圧縮再構成画像でセマンティックセグメンテーションモデルをトレーニングした場合の影響を評価すること。
  • ピクセルレベルの再構成性能が劣るにもかかわらず、GANベースの圧縮が、実世界の認識タスクにおいて標準コーデックを上回る可能性があるかどうかを同定すること。

提案手法

  • 圧縮フレームワークとしてGANベースのオートエンコーダーが使用され、共有エンコーダ/デコーダ構造と潜在的ボトルネック表現を有する。
  • 生成ネットワークは、圧縮された潜在的コードから画像を再構成するのを学習する。一方、識別器は本物の画像と生成された画像を区別するように訓練される。
  • 意味的構造を保持するために、敵対的損失と知覚的再構成損失の組み合わせでモデルが訓練される。
  • 実際の自動車バスの制約を再現し、エンドツーエンドの微分可能性を保つために、訓練プロセスに量子化が統合されている。
  • セマンティックセグメンテーションにはDeepLabv3が使用され、認識性能の主な評価指標としてmIoUが用いられる。
  • モデルは、元の画像およびJPEG2000とGAN圧縮からの再構成画像に対して評価され、耐久性を評価するためにファインチューニングプロトコルが適用される。

実験結果

リサーチクエスチョン

  • RQ1低ビットレート領域において、画像圧縮のPSNRが高ければ高いほど、意味的セグメンテーション性能も常に向上するのか?
  • RQ20.0625ビット/ピクセルのような低ビットレートにおいて、GANベースの画像圧縮はJPEG2000に比べて意味的セグメンテーションmIoUで優れているか?
  • RQ3GAN再構成画像でセマンティックセグメンテーションモデルをファインチューニングすることで、元の画像で訓練した場合に比べてmIoUはどの程度向上するか?
  • RQ4自動運転システムのための圧縮評価において、mIoUのような認識指標が、PSNR や SSIM といった従来の歪み指標を上回ることができるか?
  • RQ5バス帯域幅が制限される自動車システムにおける分散認識において、GANベースの圧縮アプローチは実用可能か?

主な発見

  • 0.0625ビット/ピクセルのレートでは、PSNRが5.91 dB高いにもかかわらず、GANベースの圧縮はJPEG2000に比べてmIoUが3.9%絶対値で向上している。
  • セマンティックセグメンテーションモデルをGAN再構成画像でファインチューニングすると、元の画像で訓練した場合に比べてmIoUが16.6%絶対値上昇(48.1%から64.7%に)する。
  • Cityscapesテストセットでは、GANベースの圧縮でモデルをGAN再構成画像でトレーニングした場合、mIoUは50.4%に達し、JPEG2000の46.0%を上回る。
  • ファインチューニングを行わない場合でも、GANベースの手法は元の画像で訓練されたモデルでmIoUが59.69%を達成し、JPEG2000がファインチューニングされた場合にのみ65.0%に達する。
  • モデルを圧縮データでファインチューニングした際、GANとJPEG2000のmIoUの差が顕著に拡大しており、GANが認識パイプラインとより相性が良いことが示唆される。
  • 従来の歪み指標(PSNRなど)は、特に低ビットレート領域では認識性能を予測するのに不適切であり、自動車システムでは認識に配慮した圧縮が不可欠であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。