[論文レビュー] VisEvent: Reliable Object Tracking via Collaboration of Frame and Event Flows
本稿では、可視イベント動画追跡のための大規模ベンチマークであるVisEventを提案するとともに、RGBカメラとイベントカメラの特徴を統合するためのクロスモダリティトランスフォーマー(CMT)を導入する。両センサの相補的な強み—可視カメラによるテクスチャの捉え方と、イベントカメラによる動きのロバスト性—を活用することで、VisEventにおいて最先端の性能を達成し、成功確率は0.430、精度は0.632を記録した。
Different from visible cameras which record intensity images frame by frame, the biologically inspired event camera produces a stream of asynchronous and sparse events with much lower latency. In practice, visible cameras can better perceive texture details and slow motion, while event cameras can be free from motion blurs and have a larger dynamic range which enables them to work well under fast motion and low illumination. Therefore, the two sensors can cooperate with each other to achieve more reliable object tracking. In this work, we propose a large-scale Visible-Event benchmark (termed VisEvent) due to the lack of a realistic and scaled dataset for this task. Our dataset consists of 820 video pairs captured under low illumination, high speed, and background clutter scenarios, and it is divided into a training and a testing subset, each of which contains 500 and 320 videos, respectively. Based on VisEvent, we transform the event flows into event images and construct more than 30 baseline methods by extending current single-modality trackers into dual-modality versions. More importantly, we further build a simple but effective tracking algorithm by proposing a cross-modality transformer, to achieve more effective feature fusion between visible and event data. Extensive experiments on the proposed VisEvent dataset, FE108, COESOT, and two simulated datasets (i.e., OTB-DVS and VOT-DVS), validated the effectiveness of our model. The dataset and source code have been released on: \url{https://github.com/wangxiao5791509/VisEvent_SOT_Benchmark}.
研究の動機と目的
- 低照度、高速、背景のごみが混在するような厳しい条件下での可視イベント動画追跡のための現実的で大規模なデータセットの不足に対処する。
- 可視データとイベントデータを効果的に統合することで追跡のロバスト性を向上させる二モダリティ追跡フレームワークの開発。
- RGBとイベントモダリティ間での相互特徴学習と統合を可能にする、シンプルだが効果的なクロスモダリティトランスフォーマー・モジュールの設計。
- 神経形状視覚追跡分野における体系的評価と前進を可能にする包括的なベンチマークとベースライン手法の確立。
- 提案手法が、複数のデータセットおよびシナリオにおいて、既存の単一モダリティおよび二モダリティ追跡器を上回る優位性を示すこと。
提案手法
- DVSおよびRGBカメラを用いて低照度、高速、ごみ混在状況下で撮影された820組の動画ペア(学習用500組、テスト用320組)を含む大規模なベンチマークであるVisEventを提案する。
- 固定時間窓内でイベントストリームを積み上げることで、イベント画像に変換し、深層学習モデルとの統合を可能にする。
- 連結、要素ごとの加算、1×1畳み込みによる統合戦略を用いて、30以上もの単一モダリティ追跡器を二モダリティ版に拡張する。
- 可視画像とイベント特徴間の双方向的特徴相互作用と注目に基づく統合を可能にするクロスモダリティトランスフォーマー(CMT)モジュールを設計する。
- CMTにおけるクロスアテンション機構を用いて、モダリティ間で関連する特徴を動的に重み付けし、追跡のための表現学習を強化する。
- VisEvent、FE108、COESOT、およびシミュレーテッドデータセット(OTB-DVS、VOT-DVS)上でモデルを評価し、ロバスト性と一般化性能を検証する。
実験結果
リサーチクエスチョン
- RQ1低照度、高速、ごみ混在状況下という現実的で大規模な可視イベント動画追跡のためのベンチマークを、体系的な二モダリティ追跡手法の評価を可能にする形で効果的に構築できるか?
- RQ2可視モダリティとイベントモダリティの特徴統合は、低照度、高速、ごみ混在状況下での追跡性能にどのように影響を与えるか?
- RQ3連結、加算、注目ベースのメカニズムといった特徴統合戦略の中で、どの方法が二モダリティ追跡で最高のパフォーマンスを発揮するか?
- RQ4クロスモダリティトランスフォーマー・モジュールは、可視データとイベントデータの相補的情報を効果的に学習・活用し、追跡精度の向上に寄与できるか?
- RQ5提案手法は、VisEventや既存のベンチマークを含む、実世界データセットとシミュレーテッドデータセットの両方でどの程度一般化できるか?
主な発見
- 提案されたVisEventベンチマークには、現実的な低照度、高速、ごみ混在シナリオ下で収集された820組の動画ペアが含まれており、二モダリティ追跡のための包括的なテストベッドを提供している。
- さまざまな統合戦略の中でも、特徴の連結がVisEventテストセットで最高のパフォーマンスを発揮し、成功確率0.426、精度0.627を達成した。
- クロスモダリティトランスフォーマー(CMT)はVisEventで成功確率0.430、精度0.632を達成し、すべてのベースライン手法および既存のSOTAトレッカーを上回った。
- CMTベースのトレッカーは、動きぼけ、低照度、高速移動の処理において優れたロバスト性を示し、定性的な可視化によって裏付けられた。
- 高速で小さな物体(例:野球)や重複するイベントストリーム(例:動く星)が関与するシナリオでは失敗事例が観察され、現在のイベント画像表現の限界が示された。
- 本研究では、イベントカメラが、効果的な統合を経て可視データと組み合わせることで、特に厳しい視覚的条件下での追跡性能を顕著に向上させることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。