[論文レビュー] GET: Group Event Transformer for Event-Based Vision
本稿では、イベントベースのビジョン向けに、空間的・時間的・極性情報の3つを新しいグループトークン表現と2つの主要モジュール、すなわちイベントデュアル自己注意(EDSA)とグループトークン集約(GTA)により分離する、Group Event Transformer(GET)という新しいビジョンTransformerバックボーンを提案する。GETは4つのイベントベース分類および2つのオブジェクト検出ベンチマークで最先端性能を達成し、CIFAR10-DVSでは84.8%のトップ精度、1Mpxでは48.4%のmAPを記録した。
Event cameras are a type of novel neuromorphic sen-sor that has been gaining increasing attention. Existing event-based backbones mainly rely on image-based designs to extract spatial information within the image transformed from events, overlooking important event properties like time and polarity. To address this issue, we propose a novel Group-based vision Transformer backbone for Event-based vision, called Group Event Transformer (GET), which de-couples temporal-polarity information from spatial infor-mation throughout the feature extraction process. Specifi-cally, we first propose a new event representation for GET, named Group Token, which groups asynchronous events based on their timestamps and polarities. Then, GET ap-plies the Event Dual Self-Attention block, and Group Token Aggregation module to facilitate effective feature commu-nication and integration in both the spatial and temporal-polarity domains. After that, GET can be integrated with different downstream tasks by connecting it with vari-ous heads. We evaluate our method on four event-based classification datasets (Cifar10-DVS, N-MNIST, N-CARS, and DVS128Gesture) and two event-based object detection datasets (1Mpx and Gen1), and the results demonstrate that GET outperforms other state-of-the-art methods. The code is available at https://github.com/Peterande/GET-Group-Event-Transformer.
研究の動機と目的
- 従来のイベントベースバックボーンが画像ベースの設計に依存しており、非同期イベントからの時間的および極性情報の活用が不十分であるという限界を解決すること。
- 時刻と極性に基づいてイベントを明示的にグループ化する新しいイベント表現を構築し、空間時間的ダイナミクスを保持すること。
- 空間的・時間的・極性的次元間での効果的なクロスドメイン特徴通信を可能にする、Transformerベースのアーキテクチャを設計すること。
- 分類およびオブジェクト検出を含む多様なイベントベースビジョンタスクにおいて優れた性能を発揮するとともに、パラメータ効率性と推論速度を維持すること。
提案手法
- 時刻と極性に基づいて非同期イベントをクラスタリングし、離散的かつ学習可能なトークンとして表現する、新しいイベント表現「グループトークン」を提案する。
- 局所的な空間的自己注意とグループ自身の自己注意を並列で実行する「イベントデュアル自己注意(EDSA)」ブロックを導入し、特徴学習を強化するためのデュアル残差接続を備える。
- 重複するグループ畳み込みを用いて、空間的および時間的・極性的ドメインに跨るトークンを集約する「グループトークン集約(GTA)」モジュールを設計し、グローバルな文脈統合を可能にする。
- 階層的な特徴学習を実現する3段階のTransformerバックボーンとしてGETを構造化し、グループトークンを段階的に統合することで受容 field を拡大する。
- 画像分類やオブジェクト検出などの下流タスクでエンドツーエンド学習が可能な、タスク固有のヘッドとGETを統合する。
- イベントグループ化の細かさを制御するグループ数ハイパーパrameter Gを最適化し、データセットごとに時間的期間に応じて調整する。
実験結果
リサーチクエスチョン
- RQ1画像ベースの表現に依存せずに、イベントストリームにおける時間的および極性的情報を効果的に活用できるビジョンTransformerバックボーンは構築可能か?
- RQ2特徴抽出段階で空間的・時間的・極性的特徴を分離することにより、イベントベースビジョンタスクの性能にどのような影響を与えるか?
- RQ3時間的および極性的次元に跨るグループ間ダイナミクスを同時にモデル化できる、自己注意機構の最適設計は何か?
- RQ4時間的期間が異なるデータセットにおいて、グループ数Gの選択がモデル性能に与える影響は何か?
- RQ5低消費電力・高スループット環境下でも、提案アーキテクチャは既存のSOTA手法を分類およびオブジェクト検出の両タスクでどの程度上回るか?
主な発見
- CIFAR10-DVSデータセットでは84.8%のトップ1精度を達成し、先行SOTA手法(例:ベースラインEDSAで81.9%)を2.9ポイント上回った。
- N-MNISTデータセットでは99.7%の精度を達成し、短時間・高スループットのイベントストリームにおいて優れた性能を示した。
- DVS128Gestureデータセットでは、グループ数Gを24に設定した場合に97.9%のトップ1精度に到達し、長時間のシーケンス行動に対して最適なグループ化が実現した。
- オブジェクト検出タスクでは、1Mpxデータセットで48.4%のmAP、Gen1で47.9%のmAPを達成し、Swin-T v2や他のSOTAモデルを上回った。
- アブレーションスタディの結果、EDSAおよびGTAモジュールが極めて重要であることが確認された。Swin-T v2 や Nested-T からの類似モジュールに置き換えると、精度が最大7.4ポイント低下した。
- 可視化結果から、EDSAを搭載したGETのみが正しく運動方向(例:反時計回りの手の振り)を捉えており、標準的な自己注意を用いるモデルは時間的・極性的モデリングが不十分なため運動を誤分類した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。