Skip to main content
QUICK REVIEW

[論文レビュー] 3D Object Detection Method Based on YOLO and K-Means for Image and Point Clouds

Xuanyu Yin, Yoko Sasaki|arXiv (Cornell University)|Apr 21, 2020
Remote Sensing and LiDAR Applications参考文献 13被引用数 4
ひとこと要約

本稿では、YOLOに基づく2次元検出とLiDAR点群におけるK-meansクラスタリングを組み合わせたリアルタイム3次元物体検出手法を提案する。2次元YOLO検出結果を3次元点群に投影し、非教師付きクラスタリングによる精緻化を行うことで、精度を向上させ、ノイズを低減する。2台の1080Ti GPU上で、1フレームあたり0.192秒の推論時間、0.856の精度を達成した。

ABSTRACT

Lidar based 3D object detection and classification tasks are essential for autonomous driving(AD). A lidar sensor can provide the 3D point cloud data reconstruction of the surrounding environment. However, real time detection in 3D point clouds still needs a strong algorithmic. This paper proposes a 3D object detection method based on point cloud and image which consists of there parts.(1)Lidar-camera calibration and undistorted image transformation. (2)YOLO-based detection and PointCloud extraction, (3)K-means based point cloud segmentation and detection experiment test and evaluation in depth image. In our research, camera can capture the image to make the Real-time 2D object detection by using YOLO, we transfer the bounding box to node whose function is making 3d object detection on point cloud data from Lidar. By comparing whether 2D coordinate transferred from the 3D point is in the object bounding box or not can achieve High-speed 3D object recognition function in GPU. The accuracy and precision get imporved after k-means clustering in point cloud. The speed of our detection method is a advantage faster than PointNet.

研究の動機と目的

  • 不規則で計算コストの高いLiDAR点群におけるリアルタイム3次元物体検出の課題に対処すること。
  • 2次元画像検出におけるYOLOの活用により、関連する点群領域に焦点を当てることで、3次元検出を高速化すること。
  • 非教師付きK-meansクラスタリングによるノイズ低減と物体境界の精緻化を通じて、3次元点群における検出精度の向上。
  • 画像ベースの検出と点群処理を統合することで、GPUアクセラレーションを活用した高速3次元物体認識を実現すること。
  • キャリブレーション済みのカメラとLiDARデータを用いたエンドツーエンドの3次元物体検出パイプラインの開発と、深度画像を用いた評価。

提案手法

  • LiDARとカメラのキャリブレーションを行い、マルチビューのカメラ画像を歪み補正して2次元と3次元データを整合させる。
  • YOLOv3(およびYOLOv1 tiny)を用いて歪み補正済み画像内の2次元物体を検出し、バウンディングボックスとクラスラベルを出力する。
  • ROSbagからの時間同期データと外挿パラメータおよび内挿パラメータを用いて、2次元検出バウンディングボックスを3次元点群にマッピングする。
  • 各2次元バウンディングボックス内に存在する3次元点群を抽出し、クラス固有の色を付けて可視化する。
  • 各検出バウンディングボックス内の点群に対してK-meansクラスタリングを適用し、ノイズを除去するとともに物体境界を精緻化する。
  • 最終的な3次元検出結果を32×1024の深度画像に変換し、ピクセル単位の指標を用いて正例と比較して評価する。

実験結果

リサーチクエスチョン

  • RQ1YOLOを用いた2次元物体検出を、3次元点群に効果的に転送することで、リアルタイム3次元検出を実現できるか?
  • RQ2K-meansクラスタリングは、点群領域のノイズ低減を通じて、3次元物体検出精度をどの程度向上させるか?
  • RQ3本手法は、PointNetなどの既存の3次元検出モデルと比較して、速度と精度の面でどのように差をつけるか?
  • RQ4バウンディングボックスの投影を通じた画像とLiDARデータの統合は、最小限の計算負荷で高精度な3次元検出を達成できるか?
  • RQ5複雑なシーンにおける3次元物体検出の再現率と適合率に、クラスタリングが及ぼす影響は何か?

主な発見

  • K-meansクラスタリングを適用した後、適合率は0.6103、適合率は0.856を達成し、非クラスタリングベースラインと比較して、適合率が1.7%、再現率が1.5%向上した。
  • K-meansクラスタリングにより、点群の数を平均31.6%削減し、ノイズを顕著に低減した一方で、物体関連の点群は保持した。
  • K-meansクラスタリングを適用した場合の平均推論時間は1フレームあたり0.192秒、クラスタリングなしでは0.19秒であり、2台の1080Ti GPU上で高いリアルタイム性能を示した。
  • PointNetと比較して、本手法は0.19秒のフレーム処理時間で高速であり、0.837 mAPという競争力のある精度を維持した。
  • 深度画像ベースの評価では、K-meansクラスタリングを適用した最終検出結果(図17)が、正例(図15)とよく一致しており、空間的整合性の向上が確認された。
  • 物体が検出されない状況では、クラスタリングにより誤検出を平均91%削減した。空フレームにおける点群データの割合は、クラスタリング前は49.15%からクラスタリング後は0.85%に低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。