Skip to main content
QUICK REVIEW

[論文レビュー] Masked Event Modeling: Self-Supervised Pretraining for Event Cameras

Sinja Klenk, David Bonello|arXiv (Cornell University)|Dec 20, 2022
Advanced Memory and Neural Computing被引用数 4
ひとこと要約

本論文は、時間的・空間的マスクをかけたイベント系列を再構成することで、ビジョントランスフォーマーベースのバックボーンを用いた自己教師あり事前学習フレームワークであるMasked Event Modeling (MEM)を提案する。大規模なラベルなしイベントデータで事前学習することで、MEMはN-ImageNet、N-Cars、N-Caltech101で最先端の精度を達成し、実世界のイベントデータにおける教師ありRGB事前学習でさえも上回り、セマンティックセグメンテーションにおいて顕著なラベル効率性と一般化性能を示した。

ABSTRACT

Event cameras asynchronously capture brightness changes with low latency, high temporal resolution, and high dynamic range. However, annotation of event data is a costly and laborious process, which limits the use of deep learning methods for classification and other semantic tasks with the event modality. To reduce the dependency on labeled event data, we introduce Masked Event Modeling (MEM), a self-supervised framework for events. Our method pretrains a neural network on unlabeled events, which can originate from any event camera recording. Subsequently, the pretrained model is finetuned on a downstream task, leading to a consistent improvement of the task accuracy. For example, our method reaches state-of-the-art classification accuracy across three datasets, N-ImageNet, N-Cars, and N-Caltech101, increasing the top-1 accuracy of previous work by significant margins. When tested on real-world event data, MEM is even superior to supervised RGB-based pretraining. The models pretrained with MEM are also label-efficient and generalize well to the dense task of semantic image segmentation.

研究の動機と目的

  • ディープラーニングタスクにおけるイベントデータの高コストかつ人的に負担なアノテーションに依存するのを軽減すること。
  • ラベルなしイベント系列の時間的・空間的構造を活用する自己教師あり事前学習フレームワークを開発すること。
  • 画像分類やセマンティックセグメンテーションなどの下流タスクにおけるイベントベースビジョンの性能を向上させること。
  • 多様なイベントデータセットおよび実世界の記録において、顕著なラベル効率性と強い一般化性能を達成すること。
  • RGBベースの事前学習を含む、従来の教師ありおよび自己教師あり手法を上回ること。

提案手法

  • 本手法は、イベント系列のランダムな時間的・空間的セグメントをマスクし、モデルがそれらを再構成するマスクされた自己符号化の目的関数を採用する。
  • ビジョントランスフォーマー(ViT)バックボーンが、タイムスタンプ付きのポリティカルイベントを含むイベントテンソルとして表現されたイベントデータを処理する。
  • モデルは、さまざまなイベントカメラおよび環境からの大規模かつ多様なラベルなしイベント記録で事前学習される。
  • 事前学習中に、マルチヘッド自己注意機構を通じて周囲のコンテキストに注目することで、欠落したイベントセグメントを予測する。
  • 事前学習後、最小限のラベル付きデータで下流タスクにファインチューニングされ、強力な少データ学習およびゼロショット性能を実現する。
  • フレームワークは、マスクされたイベント系列における再構成損失を用いてエンドツーエンドで訓練され、人為的ラベルなしでの表現学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしイベントデータにおける自己教師あり事前学習は、下流タスクにおけるイベントベースビジョンの性能を向上させることができるか?
  • RQ2実世界のイベントデータにおけるMEMと教師ありRGBベースの事前学習の比較では、どのような差が生じるか?
  • RQ3MEMは、異なるイベントデータセットおよび下流タスクにどの程度一般化できるか?
  • RQ4MEMフレームワークは、データが少ない状況下でどの程度ラベル効率的か?
  • RQ5教師なし条件下で、イベント系列のマスク再構成は意味のある空間時間的表現を学習できるか?

主な発見

  • MEMはN-ImageNet、N-Cars、N-Caltech101で最先端のトップ1精度を達成し、先行手法を顕著に上回った。
  • 実世界のイベントデータにおいて、MEMは教師ありRGBベースの事前学習を上回る分類精度を示し、優れたドメイン一般化性能を示した。
  • モデルは顕著なラベル効率性を示し、ファインチューニング時に最小限のラベル付きデータで高い性能を達成した。
  • MEMは密度予測タスクにも良好に一般化され、最小限の適応でセマンティック画像セグメンテーションにおいて強力な結果を得た。
  • 多様でラベルなしのイベント記録での事前学習により、データセットやタスクを横断して効果的に転送可能な強固な表現が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。