Skip to main content
QUICK REVIEW

[論文レビュー] YOLOX-PAI: An Improved YOLOX, Stronger and Faster than YOLOv6

Ziheng Wu, Xinyi Zou|arXiv (Cornell University)|Aug 27, 2022
CCD and CMOS Imaging Sensors被引用数 7
ひとこと要約

YOLOX-PAI は、1枚の V100 GPU で 1.0 ms 以内の推論時間で COCO で 42.8 mAP を達成する、YOLOX の強化版であり、高速な推論を実現した最先端の物体検出性能を実現している。バックボーン(RepVGG)、ネック(ASFF_Sim と GSConv)、ヘッド(TOOD-Head)の改善を統合し、PAI-Blade と統合された EasyCV プレディクター API を通じてエンドツーエンドの推論最適化が可能になっている。

ABSTRACT

We develop an all-in-one computer vision toolbox named EasyCV to facilitate the use of various SOTA computer vision methods. Recently, we add YOLOX-PAI, an improved version of YOLOX, into EasyCV. We conduct ablation studies to investigate the influence of some detection methods on YOLOX. We also provide an easy use for PAI-Blade which is used to accelerate the inference process based on BladeDISC and TensorRT. Finally, we receive 42.8 mAP on COCO dateset within 1.0 ms on a single NVIDIA V100 GPU, which is a bit faster than YOLOv6. A simple but efficient predictor api is also designed in EasyCV to conduct end2end object detection. Codes and models are now available at: https://github.com/alibaba/EasyCV.

研究の動機と目的

  • リアルタイム物体検出のための YOLOX の精度と推論速度の向上を図ること。
  • SOTA の検出コンponents(RepVGG、GSConv、ASFF_Sim、TOOD-Head)を統合し、一元的かつ使いやすいフレームワークを構築すること。
  • PAI-Blade と EasyCV の柔軟なプレディクター API を通じて、エンドツーエンドの推論加速を実現すること。
  • 初心者にも使いやすい、包括的なソリューションを提供し、高性能な物体検出器をデプロイ可能にすること。
  • V100 で 1ms 未満の推論時間で 40–50 mAP の範囲で SOTA の結果を達成すること。

提案手法

  • CSPNet よりも高速で精度の高い推論を実現する RepVGG ベースのバックボーンを採用する。
  • 畳み込み層を用いないスライスおよび平均演算を用いる軽量な特徴マッピング統合手法である ASFF_Sim を導入する。
  • パラメータ効率の良い畳み込みブロックである GSConv を採用し、精度の損失を最小限に抑えつつ、ネック部の FLOPs を削減する。
  • 共通の相互特徴マップとタスク固有のアテンションを用いる TOOD-Head を YOLOX ヘッドに統合し、検出の整合性を向上させる。
  • TensorRT や BladeDISC を用いた推論加速を含む、自動モデル最適化を実現する PAI-Blade を統合する。
  • JIT コンパイルされた前処理、最適化された NMS、モデルエクスポートをサポートする柔軟な EasyCV プレディクター API を開発する。

実験結果

リサーチクエスチョン

  • RQ1RepVGG、ASFF_Sim、GSConv は YOLOX の精度と推論速度にどのように影響を与えるか?
  • RQ2異なるバックボーンおよびネックコンponents と組み合わせた場合、TOOD-Head は YOLOX の性能を向上させることができるか?
  • RQ3PAI-Blade と EasyCV プレディクター API は、エンドツーエンドの推論遅延をどの程度短縮できるか?
  • RQ41ms の推論遅延における mAP と速度の観点から、YOLOX-PAI は YOLOv6 と比較してどのように差をつけるか?
  • RQ5EasyCV のような統合的で初心者フレンドリーなツールキットは、最小限の設定で高性能な物体検出を効果的にサポートできるか?

主な発見

  • YOLOX-PAI は、1枚の V100 GPU で 1.0 ms の推論時間で COCO で 42.8 mAP を達成し、精度と速度の両面で YOLOv6 を上回っている。
  • RepVGG ベースのバックボーンの採用により、mAP が 0.2–0.3 ポints 向上し、速度の低下は最小限に抑えられた。
  • ASFF_Sim は FLOPs やパラメータ数のわずかな増加で特徴マッピング統合を向上させたが、オリジナルの ASFF よりも推論時間が長くなった。
  • GSConv は FLOPs を 3% 削減しつつ 0.3 mAP の向上を達成し、高チャネルのネック部において高い効率性を示した。
  • 5 層のスタックされた相互畳み込み層を備えた TOOD-Head は 44.7 mAP を達成し、精度と速度のトレードオフが顕著に現れた。
  • PAI-Blade と JIT 前処理を用いたエンドツーエンド推論により、遅延は元の 24.58ms から最適化後の 4.53ms に短縮され、251% の高速化が達成された(YOLOX-s で検証)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。