Skip to main content
QUICK REVIEW

[論文レビュー] 2nd Place Solution for Waymo Open Dataset Challenge -- Real-time 2D Object Detection

Yueming Zhang, Xiaolin Song|arXiv (Cornell University)|Jun 16, 2021
Advanced Neural Network Applications参考文献 9被引用数 6
ひとこと要約

本論文は、スケール拡大とマルチモデルアンサンブル戦略を用いたYOLORベースのモデルを用いて、自律走行のためのリアルタイム2次元オブジェクト検出フレームワークを提示している。Tesla V100 GPU上で45.8msの推論遅延で、Waymo Open Dataset Challengeで75.00% L1 mAPおよび69.72% L2 mAPを達成し、2位を獲得した。

ABSTRACT

In an autonomous driving system, it is essential to recognize vehicles, pedestrians and cyclists from images. Besides the high accuracy of the prediction, the requirement of real-time running brings new challenges for convolutional network models. In this report, we introduce a real-time method to detect the 2D objects from images. We aggregate several popular one-stage object detectors and train the models of variety input strategies independently, to yield better performance for accurate multi-scale detection of each category, especially for small objects. For model acceleration, we leverage TensorRT to optimize the inference time of our detection pipeline. As shown in the leaderboard, our proposed detection framework ranks the 2nd place with 75.00% L1 mAP and 69.72% L2 mAP in the real-time 2D detection track of the Waymo Open Dataset Challenges, while our framework achieves the latency of 45.8ms/frame on an Nvidia Tesla V100 GPU.

研究の動機と目的

  • 厳密な遅延制約のもとでの自律走行におけるリアルタイム2次元オブジェクト検出の課題に対処する。
  • 標準的な検出パイプラインで見過ごされがちな小サイズのオブジェクト(特に車両や歩行者)の検出精度を向上させる。
  • Waymo Open Dataset上で高いmAP性能を維持しながら、推論速度を最適化する。
  • 複数のオブジェクトカテゴリにわたる速度と精度のバランスを取った、堅牢でスケーラブルな検出フレームワークを開発する。
  • Waymo Open Dataset Challengeのリアルタイム2次元検出トラックで最先端のパフォーマンスを達成する。

提案手法

  • COCOで高い精度と優れたリアルタイム性能を示すため、ベース検出器としてYOLORを採用する。
  • 中央領域を1.5倍にクロップ・拡大することでスケール拡大を実装し、小サイズオブジェクトの検出を向上させる。
  • オリジナル入力と拡大スケールの異なる入力戦略を用いた別々のモデルを訓練することで、マルチスケール検出能力を強化する。
  • Tesla V100上で1フレーム45.8msの推論遅延を達成するために、TensorRTを用いたモデル最適化を実施する。
  • カテゴリ固有のIoU閾値(車両: 0.75、歩行者/自転車: 0.55)を用いたクラス認識非最大抑制を実装する。
  • YOLOR-W6(車両・歩行者に優れる)とYOLOR-P6(自転車に優れる)の予測を組み合わせることで、モデルアンサンブルを実現し、全体のmAPを向上させる。

実験結果

リサーチクエスチョン

  • RQ1自律走行のためのリアルタイム2次元オブジェクト検出において、小サイズオブジェクト検出はどのように向上させられるか?
  • RQ2スケール拡大とマルチスケール入力戦略は、小サイズオブジェクトの検出性能にどのような影響を与えるか?
  • RQ3異なるYOLORバージョン間のモデルアンサンブルは、すべてのオブジェクトカテゴリにわたるmAPをどのように向上させるか?
  • RQ4アンカクラスタリングはWaymo Open Datasetに効果的に適用可能か、それともクラス不均衡のため性能が低下するか?
  • RQ5リアルタイム2次元検出において、推論速度とmAPの最適なトレードオフは何か?

主な発見

  • スケール拡大戦略により、ミニバリデーションデータセットでのmAPが1.88%向上し、小サイズオブジェクトの検出が顕著に向上した。
  • 最終的なモデルアンサンブルはミニバリデーションデータセットで66.67%のmAPを達成し、ベースライン(61.54%)から5.13%の向上を達成した。
  • Waymo Open Datasetのリーダーボードでは、75.00% L1 mAPおよび69.72% L2 mAPを達成し、2位を獲得した。
  • TensorRT最適化により推論遅延が45.8ms/フレームに低下し、70ms/フレームというリアルタイム制約を満たした。
  • オリジナルスケールと拡大スケールの異なる入力戦略を別々に訓練することで、小サイズオブジェクトの検出の頑健性が向上した。
  • YOLOR-W6は車両および歩行者でYOLOR-P6を上回ったが、YOLOR-P6は自転車で優れた性能を示し、アンサンブル戦略の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。