Skip to main content
QUICK REVIEW

[論文レビュー] YOLOPv2: Better, Faster, Stronger for Panoptic Driving Perception

Cheng Han, Qichao Zhao|arXiv (Cornell University)|Aug 24, 2022
Advanced Neural Network Applications被引用数 52
ひとこと要約

YOLOPv2 は交通オブジェクト検出、走行可能領域分割、レーン検出を同時に実行するマルチタスクネットワークを提示し、BDD100Kで最先端の速度と精度を達成(V100で91 FPS)、多タスク指標が強い。

ABSTRACT

Over the last decade, multi-tasking learning approaches have achieved promising results in solving panoptic driving perception problems, providing both high-precision and high-efficiency performance. It has become a popular paradigm when designing networks for real-time practical autonomous driving system, where computation resources are limited. This paper proposed an effective and efficient multi-task learning network to simultaneously perform the task of traffic object detection, drivable road area segmentation and lane detection. Our model achieved the new state-of-the-art (SOTA) performance in terms of accuracy and speed on the challenging BDD100K dataset. Especially, the inference time is reduced by half compared to the previous SOTA model. Code will be released in the near future.

研究の動機と目的

  • 制約のある計算資源の下でリアルタイムのパンオプティック運転認識を動機づける。
  • 共有エンコーダとタスク特化ヘッドを備えたエンドツーエンドのマルチタスクネットワークを開発する。
  • 検出、走行可能領域分割、レーン検出の精度を向上させつつ、推論速度を高水準に維持する。

提案手法

  • 3つのタスク用の3つのデコーダーヘッドを備えた共有エンコーダを使用。
  • 効果的なマルチスケール特徴統合のためにE-ELANグループ畳み込み、SPP、およびFPNを採用。
  • 各タスクに独自のFPN/ネック接続を持つ3つのタスク特化ヘッドを採用して各タスクを最適化(走行可能領域はFPNより前、レーンはより深いFPNレベルで)。
  • オブジェクト検出にはPAN+FPN融合を伴うアンカーベースのマルチスケール検出ヘッドを維持。
  • Dice損失と focal loss のハイブリッド損失をレーン/走行タスクに、交差エントロピー/ focal losses を検出に用い、MosaicとMixupの拡張でマルチタスク性能を向上。
  • Cosine Annealing with warm restarts、特定のハイパーパラメータ、および入力画像サイズの変更で訓練する(訓練時は640x640)。

実験結果

リサーチクエスチョン

  • RQ11つの効率的なマルチタスクネットワークが、運転シーンで高精度の物体検出、走行可能領域分割、レーン検出を同時に達成できるか?
  • RQ2タスクごとにデコーダーヘッドを分離し、タスク固有の特徴レベルを使用することで、速度を犠牲にすることなくパンオプティック運転認識の性能が向上するか?
  • RQ3データ拡張(Mosaic、Mixup)とハイブリッド損失が、マルチタスクの運転認識設定の3つのタスクに与える影響は?

主な発見

  • BDD100Kで交通オブジェクト検出の0.83 mAP50を達成。
  • 走行可能領域分割で0.93 mIoUを達成。
  • レーン検出の精度87.31%を達成。
  • NVIDIA Tesla V100で91 FPS、前SOTA(YOLOPの49 FPS)より高速。
  • モデルは38.9Mパラメータ(大きいが高速)で、YOLOPとHybridNetsを総合指標で上回る。
  • アブレーション研究でMosaic+Mixup、focal loss、および Dice+Focal ハイブリッド損失からの改善を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。