Skip to main content
QUICK REVIEW

[論文レビュー] Workshop on Autonomous Driving at CVPR 2021: Technical Report for Streaming Perception Challenge

Songyang Zhang, Lin Song|arXiv (Cornell University)|Jul 27, 2021
Advanced Neural Network Applications参考文献 5被引用数 7
ひとこと要約

本論文は、Argoverse-HDデータセットを用いて自動運転向けに最適化された、新規のアンカーフリーYOLOXモデルに基づくリアルタイム2次元オブジェクト検出システムを提示する。システムはTensorRTによるデプロイにより、高解像度入力(1440×2304)でも30 FPSの推論速度を達成し、テストセットで41.0のストリーミングAPを達成しており、検出のみのトラックで2位の手法を7.8 AP上回った。

ABSTRACT

In this report, we introduce our real-time 2D object detection system for the realistic autonomous driving scenario. Our detector is built on a newly designed YOLO model, called YOLOX. On the Argoverse-HD dataset, our system achieves 41.0 streaming AP, which surpassed second place by 7.8/6.1 on detection-only track/fully track, respectively. Moreover, equipped with TensorRT, our model achieves the 30FPS inference speed with a high-resolution input size (e.g., 1440-2304). Code and models will be available at https://github.com/Megvii-BaseDetection/YOLOX

研究の動機と目的

  • リアルタイム自動運転認識を目的とした高速かつ高精度な2次元オブジェクト検出システムの開発。
  • 高い推論速度を維持したまま、Argoverse-HDデータセットにおける検出性能の向上。
  • Argoverse-HDデータセットにおける限られた類似シーンの訓練データが引き起こす過学習の問題の解決。
  • TensorRTを用いた推論速度の最適化による実世界へのデプロイ対応。
  • 高解像度入力におけるストリーミング認識チャレンジで最先端のパフォーマンスを達成すること。

提案手法

  • システムは、アーキテクチャが簡素化され、ハイパーパrameterが削減された新規に設計されたアンカーフリーYOLOモデルであるYOLOXに基づく。
  • YOLOv4やYOLOv5と同様に、MosaicやMixupなどの高度なデータオーグメンテーション戦略を採用する。
  • トレーニング中のラベルアサインメントに、OTA(最適輸送割り当て)の簡素化版を用いる。
  • 特徴抽出のため、YOLOv5-L-P6と類似したC3バックボーンを採用する。
  • 推論はTensorRTで最適化され、前処理および後処理(NMS)がモデルのフォワードパスに統合され、エンドツーエンドの高速化が実現された。
  • マルチステージトレーニング戦略を採用:まずCOCOで事前学習を行い、その後、Argoverse-HD、BDD100K、Cityscapes、nuScenesなど複数のデータセットで微調整することで、頑健性と一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1アンカーフリーYOLOベースの検出器は、自動運転認識ベンチマークで優れた精度と速度を達成できるか?
  • RQ2COOで事前学習し、複数のデータセットで微調整することで、Argoverse-HDデータセットでの性能にどのような影響を与えるか?
  • RQ3大規模な入力解像度(1440×2304)が検出精度と推論遅延に与える影響は何か?
  • RQ4TensorRT最適化により、高解像度でのリアルタイム推論をどの程度実現できるか?
  • RQ5検証セットでの微調整は、テストセットにおけるオンラインストリーミングパフォーマンスをどの程度向上させるか?

主な発見

  • 提案されたYOLOXベースのシステムは、テストセットで41.0のストリーミングAPを達成し、検出のみのトラックで2位の手法を7.8 AP上回った。
  • 大規模な入力(1440×2304)条件下でも、システムは50.6のオフラインAPを達成し、高解像度環境下での強力な性能を示した。
  • TensorRTを用いた1440×2304入力でも30 FPSの推論が実現され、最小限の遅延(1枚あたり28.1 ms)でリアルタイム推論を達成した。
  • COCOで事前学習することで、ベースラインの35.4 APから42.8 APに性能が向上し、顕著な改善が確認された。
  • 複数データセットでの微調整によりAPはさらに48.7に上昇し、検証セットでの微調整によりオンラインテストパフォーマンスは41.0 APに向上した。
  • 精度と遅延のトレードオフが明確に現れた:解像度が高くなると精度は向上するが、推論時間も増加し、1440×2304では50.6 APを28.1 ms/枚で達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。