Skip to main content
QUICK REVIEW

[論文レビュー] Class-specific Anchoring Proposal for 3D Object Recognition in LIDAR and RGB Images

Amir Hossein Raffiee, Humayun Irshad|arXiv (Cornell University)|Jul 22, 2019
Advanced Neural Network Applications参考文献 24被引用数 5
ひとこと要約

本稿では、RGBおよびLIDARデータにおける3次元物体検出のためのアンカー事前分布を最適化するためのクラス固有アンカリングプロポーザル(CAP)を提案する。KITTIデータセットにおける物体の分布からクラス固有のアンカーサイズとアスペクト比を学習することで、自転車乗りに対して最大12.1%、歩行者に対して最大8.8%の3次元平均精度(AP)向上を達成した。最適なクラスタ数は、自転車乗り/歩行者に対してn=5、車両に対してn=2であった。

ABSTRACT

Detecting objects in a two-dimensional setting is often insufficient in the context of real-life applications where the surrounding environment needs to be accurately recognized and oriented in three-dimension (3D), such as in the case of autonomous driving vehicles. Therefore, accurately and efficiently detecting objects in the three-dimensional setting is becoming increasingly relevant to a wide range of industrial applications, and thus is progressively attracting the attention of researchers. Building systems to detect objects in 3D is a challenging task though, because it relies on the multi-modal fusion of data derived from different sources. In this paper, we study the effects of anchoring using the current state-of-the-art 3D object detector and propose Class-specific Anchoring Proposal (CAP) strategy based on object sizes and aspect ratios based clustering of anchors. The proposed anchoring strategy significantly increased detection accuracy's by 7.19%, 8.13% and 8.8% on Easy, Moderate and Hard setting of the pedestrian class, 2.19%, 2.17% and 1.27% on Easy, Moderate and Hard setting of the car class and 12.1% on Easy setting of cyclist class. We also show that the clustering in anchoring process also enhances the performance of the regional proposal network in proposing regions of interests significantly. Finally, we propose the best cluster numbers for each class of objects in KITTI dataset that improves the performance of detection model significantly.

研究の動機と目的

  • サイズおよびアスペクト比の変動が著しい物体に対してアンカーの不適合問題を解消することで、自動運転シナリオにおける3次元物体検出性能を向上させること。
  • AVODなど最先端の3次元検出器で見られる固定アンカープライオリティの限界を是正すること。特に、サイズの多様性により歩行者や自転車乗りの検出性能が劣化する問題を解決すること。
  • KITTIデータセットにおける物体寸法のクラスタリングを通じて、クラス固有のアンカープライオリティを学習し、アンカープロポーザルを最適化すること。
  • 物体提案用の領域提案ネットワーク(RPN)の性能を、より良い事前アンカー幾何形状の提供によって向上させること。
  • 各物体クラスにおける検出精度を最大限に高めるために最適なクラスタ数(n)を特定すること。計算コストの増加を抑えつつ、過剰な負荷を避けること。

提案手法

  • KITTIデータセットにおける各物体クラスの3次元バウンディングボックス寸法(幅、高さ、長さ)に対して、K-meansおよびガウス・ミックスチャネル・モデル(GMM)クラスタリングを適用する。
  • クラスタの重心を3次元領域提案ネットワーク(RPN)のアンカープライオリティとして使用し、固定アンカーテンプレートに代わってクラス固有のプライオリティを導入する。
  • クラス固有アンカリング戦略を、RGBとビューポイント(BEV)LIDAR特徴を統合する3次元検出のためのAVODフレームワークに統合する。
  • 3次元IoU閾値0.5を用いて、KITTIの3次元検出ベンチマーク上で修正されたCAP-AVODモデルを学習および評価する。
  • APに与える影響を評価するために、クラスタ数(n)を1から5まで系統的に変化させる。
  • 各クラスタの平均アンカー寸法を用いて、各クラスの実際の物体幾何形状に整合性の高い事前アンカー形状を定義する。

実験結果

リサーチクエスチョン

  • RQ1クラスタリングによるクラス固有アンカリングは、固定アンカープライオリティと比較して、3次元物体検出精度をどのように向上させるか?
  • RQ2KITTIデータセットにおける各物体クラス(車両、歩行者、自転車乗り)のアンカープライオリティに最適なクラスタ数(n)は何か?
  • RQ3クラスタリングに基づくアンカリングは、関連する領域の候補を提示する領域提案ネットワーク(RPN)の性能を向上させるか?
  • RQ4サイズ変動が著しい歩行者や自転車乗りにおいて、性能向上の差が顕著に現れる理由は何か?
  • RQ5提案されたアンカリング戦略は、計算コストを著しく増加させることなく高い精度を維持できるか?

主な発見

  • K-meansおよびGMMクラスタリングによるクラス固有アンカリングにより、歩行者クラスの3次元平均精度(AP)は、Easy設定で7.19%、Moderate設定で8.13%、Hard設定で8.8%向上した。
  • 自転車乗りクラスでは、Easy設定で12.1%のAP向上を達成し、サイズおよびアスペクト比の変動が著しいことから、最大の向上を示した。
  • 車両クラスでは、Easy設定で2.19%、Moderate設定で2.17%、Hard設定で1.27%のAP向上を示し、最適な性能はn=2クラスタで達成された。
  • より良い事前アンカー幾何形状のおかげで、RPNの性能が顕著に向上し、より正確な領域候補が得られた。
  • 最適なクラスタ数は、自転車乗りおよび歩行者でn=5、車両でn=2と特定された。これは、性能の飽和とAPトレンドに基づくものであった。
  • 自転車乗りおよび歩行者に対してn=5を超えてクラスタ数を増加させると、外れ値や計算負荷の増加により、利得の減少および性能低下が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。