Skip to main content
QUICK REVIEW

[論文レビュー] DART: Distribution Aware Retinal Transform for Event-based Cameras

Bharath Ramesh, Hong Yang|arXiv (Cornell University)|Oct 30, 2017
Advanced Memory and Neural ComputingEngineering参考文献 52被引用数 22
ひとこと要約

本稿では、神経生物学的カメラからの時空間的イベントデータを符号化するために対数極座標グリッドを用いる、分布に配慮した網膜変換(DART)を提案する。これにより、物体分類、追跡、検出、特徴マッチングのための頑健な特徴記述子が可能になる。DARTは、MNIST-DVSで99%の正確性を達成し、無人航空機(UAV)でもリアルタイム分類を実現するなど、複数のイベントベースのデータセットで最先端の性能を発揮する。

ABSTRACT

We introduce a generic visual descriptor, termed as distribution aware retinal transform (DART), that encodes the structural context using log-polar grids for event cameras. The DART descriptor is applied to four different problems, namely object classification, tracking, detection and feature matching: (1) The DART features are directly employed as local descriptors in a bag-of-features classification framework and testing is carried out on four standard event-based object datasets (N-MNIST, MNIST-DVS, CIFAR10-DVS, NCaltech-101). (2) Extending the classification system, tracking is demonstrated using two key novelties: (i) For overcoming the low-sample problem for the one-shot learning of a binary classifier, statistical bootstrapping is leveraged with online learning; (ii) To achieve tracker robustness, the scale and rotation equivariance property of the DART descriptors is exploited for the one-shot learning. (3) To solve the long-term object tracking problem, an object detector is designed using the principle of cluster majority voting. The detection scheme is then combined with the tracker to result in a high intersection-over-union score with augmented ground truth annotations on the publicly available event camera dataset. (4) Finally, the event context encoded by DART greatly simplifies the feature correspondence problem, especially for spatio-temporal slices far apart in time, which has not been explicitly tackled in the event-based vision domain.

研究の動機と目的

  • 時空間的イベントデータの構造的文脈を対数極座標グリッドを用いて捉える、汎用的で頑健なイベントベースカメラ用の視覚的記述子を開発すること。
  • 極端な運動、遮蔽、視点変化の下でも、イベントベースビジョンにおける物体認識と追跡の課題に取り組むこと。
  • イベントストリームデータを用いた、長期的物体追跡のためのリアルタイムでワンショット学習を可能にすること。
  • 公開データセットの正例アノテーションを拡張することで、イベントベースの長期的物体追跡のベンチマークを構築すること。
  • イベントベースビジョンにおける、遠く離れた時間スライス間の時空間的特徴対応を簡素化すること。

提案手法

  • DARTは、最新のイベントを中心とする対数極座標グリッドに過去のイベントをマップし、各ビンごとの補間されたイベント数に基づいて記述子を形成する空間的ビンニングを用いる。
  • キューを用いて正確な時空間情報を保持することで、イベント1件ごとにリアルタイムで記述子を更新する。
  • DART記述子の正規化により、明るさの変化や運動に対して頑健になり、相対的なイベント分布を捉える。
  • 分類のため、マルチスケールテストを用いたBag-of-WordsフレームワークでDART特徴を活用し、スケール不変性を向上させる。
  • 追跡のため、統計的ブートストラップとDART記述子の円形シフトを活用したワンショット学習フレームワークにより、回転およびスケールに対する耐性を高める。
  • eLOT(長期的物体追跡システム)は、局所探索トラッカーとグローバル検出モジュールを組み合わせ、クラスターメジャリティ投票を用いて再起動することで、物体再入時の追跡を強化する。

実験結果

リサーチクエスチョン

  • RQ1対数極座標ベースの記述子は、イベントベースデータにおいてスケール、回転、視点の変化に対して頑健な物体分類を達成できるか?
  • RQ2限られた学習データを用いて、イベントベースの物体追跡におけるワンショット学習をどのようにして耐性を高められるか?
  • RQ3ハイブリッドトラッカー・ディテクタフレームワークは、物体再入や遮蔽を伴う長期的物体追跡を効果的に処理できるか?
  • RQ4DART記述子は、時間的に離れた、空間的に変化するイベントストリーム間で、どれほど信頼性の高い特徴マッチングを可能にできるか?
  • RQ5提案されたシステムは、イベントベースデータを用いて、UAVなどの埋め込みプラットフォームでもリアルタイム性能を達成できるか?

主な発見

  • DARTはMNIST-DVSデータセットで99%の分類正確性を達成し、既存手法を上回った。
  • CIFAR10-DVSでは65.43%の正確性を達成し、複雑な物体認識タスクにおいても優れた性能を示した。
  • NCaltech-101では70.33%の正確性を達成し、自然画像に類似したイベントデータにおいて有効性を示した。
  • eLOTシステムは、6自由度(6-DOF)を含む多様なカメラ運動プロファイルにおいて、高精度のIoUスコアを達成し、長期的追跡の頑健性を示した。
  • Intel Core m5-6Y57 vProプロセッサ搭載のIntel Compute Stickを用いたUAVでも、リアルタイム性能を達成した。
  • DARTを用いた特徴マッチングは、大きな時間的ギャップやスケール/回転の変化に対しても、遮蔽や高速なカメラ運動の下でも、特徴の正確なマッチングに成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。