Skip to main content
QUICK REVIEW

[論文レビュー] Attention Mechanisms for Object Recognition with Event-Based Cameras

Marco Cannici, Marco Ciccone|arXiv (Cornell University)|Jul 25, 2018
Advanced Memory and Neural Computing参考文献 33被引用数 4
ひとこと要約

本論文は、イベントベースカメラを用いた物体認識のための2つのアテンションメカニズムを提案する:イベント活動を追跡するアルゴリズム的手法により注目領域を特定し、再構成されたフレームから顕著なパッチを適応的に抽出する微分可能DRAWベースのアテンションモデル。両手法とも、ベースラインのPhased LSTMに比べて並進およびスケール不変性が向上し、微分可能アプローチはN-Caltech101やCIFAR10-DVSといったマルチスケールデータセットでより優れた一般化性能を達成した。

ABSTRACT

Event-based cameras are neuromorphic sensors capable of efficiently encoding visual information in the form of sparse sequences of events. Being biologically inspired, they are commonly used to exploit some of the computational and power consumption benefits of biological vision. In this paper we focus on a specific feature of vision: visual attention. We propose two attentive models for event based vision: an algorithm that tracks events activity within the field of view to locate regions of interest and a fully-differentiable attention procedure based on DRAW neural model. We highlight the strengths and weaknesses of the proposed methods on four datasets, the Shifted N-MNIST, Shifted MNIST-DVS, CIFAR10-DVS and N-Caltech101 collections, using the Phased LSTM recognition network as a baseline reference model obtaining improvements in terms of both translation and scale invariance.

研究の動機と目的

  • 従来のモデル(例:Phased LSTM)では依然として課題とされる、イベントベース物体認識における並進およびスケール不変性の向上を目的とする。
  • フレーム再構成に依存せずに、イベントストリーム内の顕著な領域に注目するアテンションメカニズムの設計を目的とする。これにより、神経形状センシングの効率性を維持する。
  • エンド・トゥ・エンドの学習に適合する完全に微分可能なアテンションメカニズムの開発を目的とし、非微分可能なスパikingネットワークの制限を克服する。
  • ノイズが多い複雑なシーンを含む多様なデータセット上で、提案手法の評価を実施し、耐障害性および一般化性能を評価することを目的とする。
  • フレーム再構成を回避しつつ、イベントベースのアテンションによって性能を維持する完全なイベント駆動アーキテクチャの探求を目的とする。

提案手法

  • アルゴリズム的手法によるアテンションメカニズムは、空間的・時間的イベント活動を監視し、再構成されたフレームから局所的パッチを抽出することで、並進不変性を向上させる。
  • DRAWモデルに基づく微分可能なアテンションメカニズムは、イベント入力に適応させ、再帰的ネットワークを用いてパッチ抽出のための2次元ガウスフィルタのパラメータを予測する。
  • N-DRAWバージョンは、イベントシーケンスのみを用いてアテンションフィルタを予測するため、事前計算されたフレームに依存せず、エンド・トゥ・エンドの学習が可能である。
  • Leaky Frame Integratorは、時間平均化と漏れのある統合プロセスを用いて、時間的ダイナミクスを保持しながらノイズを低減する方法でフレームを再構成する。
  • ベースラインとしてPhased LSTMネットワークを採用し、関連するイベントシーケンスおよび空間領域を効率的に処理するため、アテンションモジュールを統合する。
  • アテンションメカニズムは、オブジェクトのスケールに応じて受容野のサイズを動的に調整し、小さなオブジェクトや大きなオブジェクトに対して適応的ズームを可能にする。

実験結果

リサーチクエスチョン

  • RQ1アルゴリズム的手法によるイベント活動トラッキングメカニズムは、イベントベース物体認識における並進不変性を向上させることができるか?
  • RQ2DRAWのような微分可能なアテンションメカニズムは、イベントベースデータに効果的に適応可能であり、スケール不変性を向上させることができるか?
  • RQ3マルチスケールおよびノイズの多いデータセットにおいて、アテンションベースのモデルはベースラインのPhased LSTMに比べて、正確性および耐障害性において優れているか?
  • RQ4イベントベースのアテンションメカニズムは、フレーム再構成を一切行わずに、神経形状センシングの効率性を維持しながら動作できるか?
  • RQ5背景とフォアグラウンドのイベントを明確に分離できない高ノイズ環境において、現在のアテンションメカニズムの限界は何か?

主な発見

  • アルゴリズム的手法によるアテンションメカニズムは、オブジェクト位置の変動があるデータセットにおいて、Phased LSTMベースラインに比べて並進不変性が向上した。
  • N-DRAWモデルは、大多数のデータセットでパッチベース手法と同等の性能を達成し、エンド・トゥ・エンドで学習可能なイベントベースアテンションの実現可能性を示した。
  • N-Caltech101およびCIFAR10-DVSにおいて、両提案手法はPhased LSTMベースラインを上回り、一般化性能および耐障害性の向上を示した。
  • N-DRAWモデルは、パッチのサイズを適応的に変更することで、スケール不変性を向上させた(小さなオブジェクトを拡大し、大きなオブジェクトを維持)。これにより特徴の一貫性が向上した。
  • 改善が見られたものの、状態を凌駕する正確性(例:CIFAR10-DVSで65.43%)に達しなかった。主な要因は、ノイズの多いシーンにおけるフォアグラウンドと背景の分離が不十分であったことにある。
  • 性能差は、訓練データの不足および神経形状ドメインにおいて事前学習済み特徴抽出器が利用できない状況下での有効なフィルタ変換の学習の難しさに起因するとされた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。