Skip to main content
QUICK REVIEW

[論文レビュー] Adaptable Deformable Convolutions for Semantic Segmentation of Fisheye Images in Autonomous Driving Systems

Clément Playout, Ola Ahmad|arXiv (Cornell University)|Feb 19, 2021
Advanced Neural Network Applications参考文献 20被引用数 17
ひとこと要約

本稿では、変形可能畳み込みを用いて、魚眼画像を処理するためのセマンティックセグメンテーションモデルの新規適応手法を提案する。この手法により、ラベル付き魚眼データを最小限に抑えても高い性能を達成できる。主ネットワークの重みを微調整せずに畳み込みフィルタの空間的オフセットを学習することで、わずか50枚の学習サンプルで、魚眼画像セグメンテーションにおいて最先端の性能を達成し、大規模なアノテート済みデータセットへの依存を顕著に低減する。

ABSTRACT

Advanced Driver-Assistance Systems rely heavily on perception tasks such as semantic segmentation where images are captured from large field of view (FoV) cameras. State-of-the-art works have made considerable progress toward applying Convolutional Neural Network (CNN) to standard (rectilinear) images. However, the large FoV cameras used in autonomous vehicles produce fisheye images characterized by strong geometric distortion. This work demonstrates that a CNN trained on standard images can be readily adapted to fisheye images, which is crucial in real-world applications where time-consuming real-time data transformation must be avoided. Our adaptation protocol mainly relies on modifying the support of the convolutions by using their deformable equivalents on top of pre-existing layers. We prove that tuning an optimal support only requires a limited amount of labeled fisheye images, as a small number of training samples is sufficient to significantly improve an existing model's performance on wide-angle images. Furthermore, we show that finetuning the weights of the network is not necessary to achieve high performance once the deformable components are learned. Finally, we provide an in-depth analysis of the effect of the deformable convolutions, bringing elements of discussion on the behavior of CNN models.

研究の動機と目的

  • 超広視野(FoV)レンズによる強い幾何的歪みを示す魚眼画像に事前学習済み畳み込みニューラルネットワーク(CNN)を適用する課題に対処すること。
  • 実際の魚眼画像のラベル付きアノテーションが大規模かつ時間のかかる作業であることを踏まえ、少数のラベル付きサンプルでのモデル適応により、その依存度を低減すること。
  • 事前学習済み重みを保持しつつ、変形可能畳み込みによる空間的オフセットの学習によって、柔軟で即座に統合可能な適応メカニズムを開発すること。
  • 変形可能畳み込みが、ネットワーク全体を再訓練せずに、魚眼画像の非線形的歪みを効果的にモデル化できるかどうかを評価すること。
  • 将来的にアノテート済み魚眼データの必要性をさらに低減するため、自己教師付きオフセット学習の可能性を検討すること。

提案手法

  • 本手法は、元のネットワーク重みを変更せずに、事前学習済みの標準的CNN層の上に変形可能畳み込みを適用することで、魚眼画像に適応させる。
  • 畳み込みフィルタのための学習可能な空間的オフセットを導入し、バケツ型歪みに対応するために、サンプリング位置を動的に調整可能にする。
  • 変形可能コンponentは、交差エントロピー損失を用いてバックプロパゲーションで学習されるが、他のネットワーク部は適応中は固定される。
  • 本手法は、歪み度合い(fパラメータでパrameter化)が異なるシミュレーテッド魚眼データ上で評価され、CityscapesおよびBlendedMVSデータセットが使用される。
  • 主ネットワーク重みとは独立して適応が行われ、バッチ正規化層のみをオプションで微調整することが許可される。
  • 学習セットサイズを1、50、100、1000と変化させ、データの有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みCNNを主ネットワークを再訓練せずに、魚眼画像のセマンティックセグメンテーションに適応するために、変形可能畳み込みを効果的に使用できるか?
  • RQ2本手法を用いる場合、顕著な性能向上を得るには、どの程度のラベル付き魚眼画像が必要か?
  • RQ3元のネットワーク重みを固定したまま、変形可能オフセットのみを学習することは、完全な微調整や再訓練と同等の性能を達成できるか?
  • RQ4再訓練なしに、異なる魚眼カメラパラメータ(例:f値の変化)に対しても本手法が汎用性を示せるか?
  • RQ5本適応メカニズムを自己教師学習に拡張することで、ラベル付き魚眼データの必要性を完全に排除できるか?

主な発見

  • わずか50枚のラベル付き魚眼画像を用いても、f=125のCityscapesデータセットで平均交差率(mIoU)が0.643に達し、新規に訓練したモデルの性能に近づいた。
  • 適応なしのモデルではmIoUが0.420であったのに対し、適応後は0.643に向上し、少量のデータで顕著な性能向上が確認された。
  • 1枚のラベル付き魚眼画像でもmIoUが0.390に低下したが、これは適応に最低限のデータ閾値が必要であることを示しており、小さなデータ増加で性能が急速に向上することを示している。
  • 適応モデルは、mIoUが0.615の再訓練ベースライン(fish-DL3)を上回り、2675枚の全訓練セットを使用した場合にmIoUが0.676に達した。
  • 主ネットワーク重みを微調整せずに高い性能を達成したため、オフセット学習のみで効果的な適応が可能であることが証明された。
  • 結果から、変形可能畳み込みが魚眼画像の非線形的歪みを効果的にモデル化でき、最小限のデータと計算コストで頑健な適応が可能であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。