Skip to main content
QUICK REVIEW

[論文レビュー] An Energy-Efficient Quad-Camera Visual System for Autonomous Machines on FPGA Platform

Zishen Wan, Yuyang Zhang|arXiv (Cornell University)|Apr 1, 2021
Robotics and Sensor-Based Localization参考文献 13被引用数 4
ひとこと要約

本稿では、ハードウェア同期、フレーム多重化、並列化された ORB 特徴抽出およびマッチングを活用して、リアルタイムの自律マシン局所化を実現する、エネルギー効率に優れた FPGA ベースの4カメラ視覚システムを提示する。Nvidia TX1 より 5.6倍の高速化と 3.0倍の消費電力削減を達成し、Intel i7 より 34.6倍高いエネルギー効率を実現した。これにより、エッジアプリケーションにおいて低遅延かつ高信頼性の 360° パーセプションが可能になる。

ABSTRACT

In our past few years' of commercial deployment experiences, we identify localization as a critical task in autonomous machine applications, and a great acceleration target. In this paper, based on the observation that the visual frontend is a major performance and energy consumption bottleneck, we present our design and implementation of an energy-efficient hardware architecture for ORB (Oriented-Fast and Rotated- BRIEF) based localization system on FPGAs. To support our multi-sensor autonomous machine localization system, we present hardware synchronization, frame-multiplexing, and parallelization techniques, which are integrated in our design. Compared to Nvidia TX1 and Intel i7, our FPGA-based implementation achieves 5.6x and 3.4x speedup, as well as 3.0x and 34.6x power reduction, respectively.

研究の動機と目的

  • 自律マシン局所化システムにおける主なパフォーマンスおよびエネルギーのボトル neck であるビジュアルフロントエンドを解決すること。
  • リソース制限のある FPGA プラットフォーム上で、マルチカメラ 360° パーセプションを実現する低消費電力でリアルタイムの視覚システムを設計すること。
  • 全球的カバーと重複するフレーム領域を活用して、信頼性が高く故障に強い局所化を実現すること。
  • ORB を用いた特徴抽出およびマッチングのためのハードウェアを共同最適化し、遅延と消費電力を最小限に抑えること。
  • 複数のカメラと IMU を統合するために、新規のハードウェア同期方式を採用し、信頼性の高いビジュアルインertialオドメトリを実現すること。

提案手法

  • マイクロ秒レベルの精度で複数のカメラおよび IMU のデータストリームを同期するハードウェア同期を実装し、センサー間の時間的一致性を確保する。
  • フレーム多重化を用いて、左および右のステレオフレーム間で1つの ORB 特徴抽出器を時分割で共有し、ハードウェアリソース使用量を 33% 減少させる。
  • 4つのカメラチャネルおよび特徴処理ステージにわたる並列処理とパイプライン処理を適用し、スループットを最大化し、遅延を最小限に抑える。
  • 特徴マッチャーに対してワード長最適化を適用し、リソース使用量を削減しながらも精度を維持する。
  • ステレオペア間で共有される論理回路を有する統合型 ORB ベースのビジュアルフロントエンドを共同設計し、面積オーバーヘッドを低減する。
  • Xilinx Zynq Ultrascale+ FPGA 上にシステムを実装し、動的リソース割り当ておよびデータフローマネジメントのためのカスタム制御論理を統合する。

実験結果

リサーチクエスチョン

  • RQ1FPGA ベースの視覚システムは、マルチカメラの自律局所化に実時間性能と低消費電力の両立をどのように達成できるか?
  • RQ2ORB を用いた特徴抽出およびマッチングにおいて、高い正確性を維持しながらリソース使用量を効果的に削減するためのハードウェア技術は何か?
  • RQ34台のカメラおよび IMU 間でハードウェア同期をどのように実現し、信頼性の高いビジュアルインエラスティックオドメトリを確保できるか?
  • RQ4フレーム多重化と並列処理は、マルチセンサ視覚システムにおけるスループットとエネルギー効率をどの程度向上できるか?
  • RQ5実世界の局所化ワークロードにおいて、提案手法は GPU や CPU ベースの実装と比較して、パフォーマンスおよびエネルギー効率でどの程度優れているか?

主な発見

  • FPGA ベースのシステムは 640×480 解像度で 69 fps を達成し、Nvidia TX1 より 5.63 倍の高速化、Intel i7 CPU より 3.38 倍の高速化を実現した。
  • 640×480 解像度での消費電力は 1.63 W にまで低下し、Nvidia TX1 と Intel i7 に対してそれぞれ 3.03 倍および 34.63 倍高いエネルギー効率を達成した。
  • FPGA 上での特徴抽出およびマッチングの正確性は、ソフトウェア実装と 0.3% 以内の誤差で一致し、すべての指標で座標正確性が 96.8% から 99.7% の範囲に収まった。
  • リソース使用量は効率的に管理されており、640×480 処理において LUT 51%、フリップフロップ 12%、BRAM 30%、DSP 1% のみが使用された。
  • 連続するフレーム間で常に重複領域が確保されるため、障害のリスクのない堅牢な 360° パーセプションが可能になった。
  • 先行する FPGA アクcelerator と比較して、本設計は [7] より 1.23 倍の高速化と 16% の消費電力削減を達成し、[4] より 64% の消費電力削減を実現した。また、ステレオ深度とマルチカメラ入力をサポートしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。