Skip to main content
QUICK REVIEW

[論文レビュー] XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model

Ho Kei Cheng, Alexander G. Schwing|arXiv (Cornell University)|Jul 14, 2022
Visual Attention and Saliency Detection被引用数 15
ひとこと要約

XMemは、アトキンソン=シフリンの記憶モデルにインspiredされたマルチストア記憶アーキテクチャを提案し、感覚記憶、作業記憶、長期記憶の各ストアを統合し、記憶の強化および統合メカニズムを備える。長時間動画ベンチマークで最先端の性能を達成するとともに、短時間動画でも高い精度を維持し、GPUメモリ使用量を最小限に抑え、リアルタイム推論が可能である。

ABSTRACT

We present XMem, a video object segmentation architecture for long videos with unified feature memory stores inspired by the Atkinson-Shiffrin memory model. Prior work on video object segmentation typically only uses one type of feature memory. For videos longer than a minute, a single feature memory model tightly links memory consumption and accuracy. In contrast, following the Atkinson-Shiffrin model, we develop an architecture that incorporates multiple independent yet deeply-connected feature memory stores: a rapidly updated sensory memory, a high-resolution working memory, and a compact thus sustained long-term memory. Crucially, we develop a memory potentiation algorithm that routinely consolidates actively used working memory elements into the long-term memory, which avoids memory explosion and minimizes performance decay for long-term prediction. Combined with a new memory reading mechanism, XMem greatly exceeds state-of-the-art performance on long-video datasets while being on par with state-of-the-art methods (that do not work on long videos) on short-video datasets. Code is available at https://hkchengrex.github.io/XMem

研究の動機と目的

  • 単一の特徴記憶ストアに依存する従来のビデオオブジェクトセグメンテーション手法が示すスケーラビリティの限界を解消すること。これにより、長時間動画におけるGPUメモリ使用量の増加と性能の低下が生じる。
  • 短時間動画の性能を損なわず、3倍以上長い動画(例:標準ベンチマークの3倍)においても、正確でリアルタイムかつメモリ効率の良いビデオオブジェクトセグメンテーションを実現すること。
  • 人間の記憶プロセス(感覚記憶、作業記憶、長期記憶)を模倣する生物学的インスパイアド記憶アーキテクチャを開発すること。これには、別個で接続された特徴記憶ストアが含まれる。
  • 記憶の強化および統合アルゴリズムを設計し、コンパクトで高精度な長期記憶の保存を可能にするとともに、記憶の爆発と表現のずれを防止すること。

提案手法

  • XMemは、急速に更新される感覚記憶(GRUベース)、歴史的なフレームを集約する高解像度の作業記憶、および持続的保存を目的としたコンパクトな長期記憶の3つの特徴記憶ストアを採用する。
  • 記憶の強化アルゴリズムにより、作業記憶から選択されたプロトタイプに、より豊富なマルチスケール特徴を集約してから長期記憶に格納することで、サブサンプリングによるアリヤシングを低減する。
  • 使用統計に基づいて、定期的にアクティブな作業記憶要素を長期記憶に移行する記憶統合メカニズムを採用し、過剰なメモリ増加を防ぎながら長期的保持を確保する。
  • 空間的・時間的記憶読み取り機構により、クエリフレームと作業記憶・長期記憶ストア間の注目ベースの特徴マッチングを実現し、選択および収縮項を含む非等方的L2類似度を用いる。
  • 感覚記憶へのディープアップデートをrフレームごとに適用し、時間的整合性を維持するとともに、ドリフトを低減する。計算オーバーヘッドは最小限に抑えられる。
  • 特徴エンコーダーとマスクヘッドを備えた二重ブランチネットワークを採用し、記憶ストアをオンラインでストリーミング形式で更新および読み取りする。

実験結果

リサーチクエスチョン

  • RQ1人間の認知にインスパイアされたマルチストア記憶アーキテクチャは、低メモリ消費量を維持しながら、長期記憶のビデオオブジェクトセグメンテーションの精度を向上させることができるか?
  • RQ2感覚記憶、作業記憶、長期記憶ストアの統合は、単一記憶ベースラインと比較して、長時間動画における性能にどのような影響を与えるか?
  • RQ3記憶の強化および統合は、長時間動画シーケンスにおける長期記憶の忠実度をどの程度向上させ、性能の低下を軽減するか?
  • RQ4統合された記憶アーキテクチャは、推論速度やメモリ効率を損なわず、短時間および長時間動画ベンチマークの両方で最先端の性能を達成できるか?

主な発見

  • Long-time Video (3×)データセットにおいて、XMemは90.0 ± 0.4のJ&Fスコアを達成し、長時間動画で困難を示す先行最先端手法を顕著に上回った。
  • 標準のDAVIS 2017ベンチマークでは、XMemは89.8 ± 0.2のJ&Fスコアを達成し、長時間動画にスケーリングできないトップレベルの手法と同等の性能を発揮した。
  • 使用量ベースのプロトタイプ選択と特徴強化を組み合わせた記憶の強化アルゴリズムにより、長期記憶の品質が向上し、非強化ベースライン比で2.1%の性能向上を達成した。
  • 使用量ベースの選択とP=128プロトタイプを用いた記憶統合により、性能とメモリ圧縮のバランスが最適化され、ランダム、k-means、ローカルウィンドウ戦略を上回った。
  • 非等方的L2類似度と二重スケーリング項(選択および収縮)を備えた空間的・時間的記憶読み取り機構により、注目精度と耐障害性が向上し、アブレーション実験で両要素の相乗効果が示された。
  • rフレームごとのディープアップデートにより、0.5–1.0のJ&Fポイントの性能向上が達成され、速度への影響は無視できるほど小さく、感覚記憶品質の維持効果が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。