Skip to main content
QUICK REVIEW

[論文レビュー] Graph-Based Object Classification for Neuromorphic Vision Sensing

Yin Bi, Aaron Chadha|arXiv (Cornell University)|Aug 19, 2019
Advanced Memory and Neural Computing参考文献 34被引用数 8
ひとこと要約

本稿では、神経モルフィックビジョンセンサー(NVS)スパイクイベントのグラフベース表現を提案し、エンドツーエンドのオブジェクト分類を実現するリーマンスグラフ畳み込みニューラルネットワーク(RG-CNN)を導入する。時間的・空間的スパイクパターンをグラフとしてモデル化することで、従来のResNet50と比較して5倍少ない計算量で最先端の精度を達成した。また、ベンチマーク用に、実世界の条件で収集された10万件のアメリカンサイン言語の文字を含む新しい大規模実データNVスパイクデータセットを提供した。

ABSTRACT

Neuromorphic vision sensing (NVS)\ devices represent visual information as sequences of asynchronous discrete events (a.k.a., ``spikes'') in response to changes in scene reflectance. Unlike conventional active pixel sensing (APS), NVS allows for significantly higher event sampling rates at substantially increased energy efficiency and robustness to illumination changes. However, object classification with NVS streams cannot leverage on state-of-the-art convolutional neural networks (CNNs), since NVS does not produce frame representations. To circumvent this mismatch between sensing and processing with CNNs, we propose a compact graph representation for NVS. We couple this with novel residual graph CNN architectures and show that, when trained on spatio-temporal NVS data for object classification, such residual graph CNNs preserve the spatial and temporal coherence of spike events, while requiring less computation and memory. Finally, to address the absence of large real-world NVS datasets for complex recognition tasks, we present and make available a 100k dataset of NVS recordings of the American sign language letters, acquired with an iniLabs DAVIS240c device under real-world conditions.

研究の動機と目的

  • フレームベース構造を持たないNVSデータは従来のCNNに不適切であるため、NVSデータに効果的なディープラーニング手法の欠如に取り組む。
  • スパイクイベントの時間的・空間的整合性を保持しつつ、コンactで効率的かつエンドツーエンドでトレーニング可能な表現を構築する。
  • 複雑な認識タスクに適した大規模かつ実世界のラベル付きNVSデータセットの不足を克服する。
  • 非同期イベントストリーム上でグラフベースのディープラーニングを用いて、高精度かつ低複雑度のオブジェクト分類を実現する。

提案手法

  • ノードを空間的位置とタイムスタンプに対応させ、エッジで時間的・空間的近接性を符号化することで、NVSスパイクイベントを動的グラフとして表現する。
  • グラフ構造データを処理できる学習可能なフィルタとスキップ接続を持つ、新規のリーマンスグラフ畳み込みニューラルネットワーク(RG-CNN)アーキテクチャを設計する。
  • グラフ畳み込みにBスプライン基底関数を採用し、局所的支持を確保するとともに、カーネルサイズに依存しないFLOPs削減を実現する。
  • 各グラフ畳み込みの後にマックスプーリング層を適用し、構造的情報を保持したままグラフをダウンサンプリングする。
  • 2段階のトレーニングパイプラインを採用:まず合成イベントデータセットで事前学習し、その後実世界のNVSデータでファインチューニングする。
  • 空間的ビニングと時間的集約を用いてスパイクストリームからイベント画像を構築し、従来のCNNとの比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1グラフベース表現は、神経モルフィックビジョンセンサー(NVS)スパイクイベントの時間的・空間的ダイナミクスをオブジェクト分類に有効にモデル化できるか?
  • RQ2リーマンスグラフCNNアーキテクチャは、NVSデータにおいて、従来のCNNや既存のイベントベース手法を上回る精度を達成するとともに、計算コストを低減できるか?
  • RQ3グラフ畳み込みネットワークの深さとカーネルサイズが、性能とモデル複雑度にどのように影響するか?
  • RQ4実世界で収集された大規模かつ正確にラベル付けされたNVSデータセットは、オブジェクト分類モデルの一般化性能とベンチマークの質を向上できるか?
  • RQ5本手法は、NVSデータに適用した場合、標準的なCNN(例:ResNet50)と比較して、計算量とメモリ使用量をどの程度削減できるか?

主な発見

  • 提案されたRG-CNNは、N-Caltech101データセットでトップ-1精度65.7%を達成し、同じ入力解像度でResNet50(63.7%)を上回った。計算量はわずか0.79 GFLOPsに留まった。
  • 4層のグラフ畳み込み層(D=4)を備えたモデルが、精度63.0%と計算量0.39 GFLOPsの最良なトレードオフを達成し、より深いモデルに比べて優れた性能を示した。
  • グラフ畳み込みのカーネルサイズが5の場合、テストされたサイズ(2–6)の中で最高の精度63.0%を達成し、モデルサイズの増加もわずか(18.81 MB)に抑えられた。
  • 提案手法は、ResNet50の1/5のFLOPsで実行可能であり、高い精度を達成したにもかかわらず、顕著な計算効率の向上を示した。
  • 実世界の条件で収集された10万件のアメリカンサイン言語の文字を含む新しいNVSデータセットは、これまでで最大の公開済み実世界ラベル付きNVSデータセットである。
  • RG-CNNは、N-Caltech101や新しいASLデータセットを含む複数のベンチマークで、最先端の手法を上回るか同等の性能を示した。また、推論コストは低く抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。