Skip to main content
QUICK REVIEW

[論文レビュー] Training-Time-Friendly Network for Real-Time Object Detection

Zili Liu, Zhengkai Tu|arXiv (Cornell University)|Sep 2, 2019
Advanced Neural Network Applications参考文献 24被引用数 12
ひとこと要約

この論文では、トレーニング時間に優しく、リアルタイムなオブジェクト検出を実現するTTFNetを提案する。TTFNetは、オブジェクトの中心周辺に密度の高い重み付きトレーニングサンプルを生成するガウスカーネルベースのエンコーディングを用いることで、収束を加速させ、従来のリアルタイム検出器(例:CenterNet)と比較してトレーニング時間を7倍以上短縮しながら、MS COCO上での高いAPスコアと高速な推論速度を維持する。

ABSTRACT

Modern object detectors can rarely achieve short training time, fast inference speed, and high accuracy at the same time. To strike a balance among them, we propose the Training-Time-Friendly Network (TTFNet). In this work, we start with light-head, single-stage, and anchor-free designs, which enable fast inference speed. Then, we focus on shortening training time. We notice that encoding more training samples from annotated boxes plays a similar role as increasing batch size, which helps enlarge the learning rate and accelerate the training process. To this end, we introduce a novel approach using Gaussian kernels to encode training samples. Besides, we design the initiative sample weights for better information utilization. Experiments on MS COCO show that our TTFNet has great advantages in balancing training time, inference speed, and accuracy. It has reduced training time by more than seven times compared to previous real-time detectors while maintaining state-of-the-art performances. In addition, our super-fast version of TTFNet-18 and TTFNet-53 can outperform SSD300 and YOLOv3 by less than one-tenth of their training time, respectively. The code has been made available at \url{https://github.com/ZJULearning/ttfnet}.

研究の動機と目的

  • リアルタイムオブジェクト検出器におけるトレーニング時間、推論速度、精度の間のアンバランスを解消すること。
  • CenterNetのような最先端のリアルタイム検出器における遅い収束は、限られたトレーニングサンプルからの不十分な教師信号に起因することを特定すること。
  • ミニバッチサイズやモデルの複雑さを増加させることなく、有効なトレーニング信号を増加する手法を開発すること。
  • 一様でアンカーフリーな検出ヘッドを設計し、高速な推論と効率的なトレーニングを可能にすること。
  • 特に計算リソースが限られた研究者にとっても、最小限のトレーニング時間で最先端の性能を達成すること。

提案手法

  • オブジェクトの中心周辺に密度の高い、空間的に意識されたトレーニングサンプルを生成するため、ガウスカーネルを用いる。これにより、スパarsなアンカーベースの監視や、中心のみを対象とする監視に置き換える。
  • 各空間的位置におけるガウス確率をサンプルの重みとして扱い、回帰の際に中心に近い高品質なサンプルに重点を置く。
  • 適応的正規化を適用して、小形および大形オブジェクトの両方の情報が保持されるようにし、監視の曖昧さを低減する。
  • 軽量なヘッドを備えた単段階的でアンカーフリーな検出器アーキテクチャにガウスエンコーディングを統合し、高速な推論を維持する。
  • 有効なトレーニングサンプル数の増加を、より大きなバッチサイズの代理として活用し、高い学習率を可能にし、収束を高速化する。
  • バックボーン(例:ResNet風)にショートカット接続を導入することで、トレーニングコストを増加させることなく、特徴表現と精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1カーネルベースのエンコーディングによる有効なトレーニングサンプル数の増加は、リアルタイム検出器の収束を加速させることができるか?
  • RQ2推論速度が速いにもかかわらず、CenterNetのような最先端のリアルタイム検出器が長時間トレーニングを要するのはなぜか?
  • RQ3矩形または中心のみの監視に比べて、ガウスカーネルベースのサンプルエンコーディングは収束速度および精度の両面で優れているか?
  • RQ4提案手法は、従来のリアルタイム検出器と比較して、トレーニング時間を著しく短縮しながらも、性能を維持または向上させることができるか?
  • RQ5本手法は、最小限の事前学習と限られた計算リソースで、スクラッチから競争力のある性能を達成できるか?

主な発見

  • TTFNetは、CenterNetや他のリアルタイム検出器と比較して、トレーニング時間を7倍以上短縮しながら、MS COCO上での最先端のAPスコアを達成した。
  • 超高速なTTFNet-18は、8×GTX 1080Tiで1.8時間のトレーニング後、112 FPSで25.9のAPを達成した。これはSSD300のトレーニング時間の10分の1未満である。
  • TTFNet-53は3.1時間のトレーニング後、55 FPSで32.9のAPを達成し、YOLOv3よりも精度と速度の両面で優れており、トレーニング時間はその10分の1に満たない。
  • 長時間トレーニング版のTTFNet-53は31時間のトレーニング後、57 FPSで39.3のAPに達し、強力なスケーラビリティと性能を示した。
  • TTFNet-18を用いたスクラッチからのトレーニングでは、19時間で30.3のAPを達成し、高性能な事前学習バックボーンが必須でないことが示された。
  • TTFNetの標準的なアップサンプリング層をCenterNetの独自のものに置き換えると性能が向上するが、TTFNetは依然としてトレーニング効率と収束速度の面でCenterNetを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。