Skip to main content
QUICK REVIEW

[論文レビュー] Feature Selective Small Object Detection via Knowledge-based Recurrent Attentive Neural Network

Kai Yi, Zhiqiang Jian|arXiv (Cornell University)|Mar 13, 2018
Advanced Neural Network Applications参考文献 22被引用数 7
ひとこと要約

本稿では、ドメイン知識とアテンションメカニズムを用いて顕著な特徴を効果的に強調することで、自動運転における小サイズ物体検出を向上させる知識ベース型再帰的注意ニューラルネットワーク(KB-RANN)を提案する。KITTIおよびBTSDデータセットにおいて最先端の精度を達成するとともに、リアルタイムの推論速度を維持しており、TensorRT最適化を用いた埋め込み型TX2プラットフォーム上でも10 FPSで正常にデプロイされている。

ABSTRACT

At present, the performance of deep neural network in general object detection is comparable to or even surpasses that of human beings. However, due to the limitations of deep learning itself, the small proportion of feature pixels, and the occurence of blur and occlusion, the detection of small objects in complex scenes is still an open question. But we can not deny that real-time and accurate object detection is fundamental to automatic perception and subsequent perception-based decision-making and planning tasks of autonomous driving. Considering the characteristics of small objects in autonomous driving scene, we proposed a novel method named KB-RANN, which based on domain knowledge, intuitive experience and feature attentive selection. It can focus on particular parts of image features, and then it tries to stress the importance of these features and strengthenes the learning parameters of them. Our comparative experiments on KITTI and COCO datasets show that our proposed method can achieve considerable results both in speed and accuracy, and can improve the effect of small object detection through self-selection of important features and continuous enhancement of proposed method, and deployed it in our self-developed autonomous driving car.

研究の動機と目的

  • 複雑な現実世界の自動運転シーンにおける小サイズ物体(特に交通標識や歩行者)の検出という、長年の課題に取り組むこと。
  • ドメイン固有の知識(例:運転可能な領域に注目する人の視線バイアス)を深層学習モデルに統合することで、小サイズ物体の検出精度を向上させること。
  • 複数の特徴マップ層にわたって顕著な特徴を的確に強化する再帰的アテンションメカニズムを用いて、特徴表現を向上させること。
  • 低消費電力の埋め込み型プラットフォーム上でリアルタイム推論を達成すること。これは自動運転車両へのデプロイに不可欠である。
  • KITTIからBTSDへの効果的な知識の転送を可能にするとともに、埋め込みデプロイを支援するためのモデル圧縮を実現すること。

提案手法

  • 小サイズ物体検出の向上を目的に、完全畳み込み層を備えた変更版SqueezeNetバックボーンに加え、マルチスケール入力をサポートする追加のファイアモジュールを導入している。
  • 学習されたアテンション重みを通じて高重要度の特徴に注目することで、繰り返し特徴表現を精錬する、新しい再帰的アテンションニューラルネットワーク(RANN)モジュールを導入している。
  • 人間が中心部の運転可能な領域に注目する傾向があることや、その領域に交通標識が存在するといったドメイン知識を、空間バイアスとしてネットワークに組み込み、特徴アテンションを誘導している。
  • 強化された特徴マップを処理するための段階的な小規模なConvNetアーキテクチャを採用し、最終的な検出出力を得るためにソフトマックス回帰を用いている。
  • モデル圧縮のため、知識蒸留とチャネルプルーニングを適用しており、埋め込み型システムへの効率的デプロイを可能としている。
  • NVIDIA Jetson TX2プラットフォーム上で推論を高速化するためにTensorRTを用いており、リアルタイム性能を達成している。

実験結果

リサーチクエスチョン

  • RQ1ドメイン固有の知識と人間の注目バイアスを統合することで、自動運転シナリオにおける小サイズ物体検出が向上するか?
  • RQ2再帰的アテンションメカニズムは、複数の特徴マップ層にわたって小サイズ物体の特徴表現をどのように向上させるか?
  • RQ3知識誘導型でアテンションベースのネットワークは、RetinaNet や SqueezeDet といった標準的なワンステージ検出器に比べ、精度と速度の両面でどれほど優れているか?
  • RQ4KB-RANNモデルは、微調整を最小限に抑えても、KITTIからBTSDへのデータセット間での一般化が可能か?
  • RQ5モデル圧縮および高速化(例:TensorRTを用いたもの)は、実世界の自動運転車両における低消費電力埋め込みプラットフォームへのKB-RANNのデプロイにおいて、どれほど効果的か?

主な発見

  • KITTIデータセットでは、IoU=0.3の条件下でmAPが0.90、IoU=0.5の条件下でmAPが0.71を達成しており、Faster R-CNN、RetinaNet、SqueezeDet、KB-RCNNを上回っている。
  • 入力解像度を低くしたBTSDデータセット(541×412)においても、mAPが0.90(IoU=0.3)および0.71(IoU=0.5)を達成しており、解像度変更に対して強い一般化性と頑健性を示している。
  • TX2プラットフォーム上では、ポストプロセッシングおよびI/Oを含む完全な処理パイプラインで9.45 FPSを達成しており、リアルタイム動作を示している。
  • KB-RANNは顕著な知識転送能力を示しており、微調整なしにKITTIから直接BTSDに転送した場合でも高い性能を発揮している。
  • 自社開発の自動運転車両に正常にデプロイされ、TensorRT最適化後、TX2プラットフォーム上で10 FPSのリアルタイム検出が達成されている。
  • 可視化結果から、遮蔽やぼやけた状態でも、Faster R-CNN や SqueezeDet よりもKB-RANNが小サイズの交通標識をより効果的に検出できていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。