Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Regional Memory Network for Video Object Segmentation

Haozhe Xie, Hongxun Yao|arXiv (Cornell University)|Mar 24, 2021
Advanced Image and Video Retrieval Techniques参考文献 38被引用数 9
ひとこと要約

本稿では、類似物体による曖昧さと計算コストを低減するために、メモリ内のオブジェクト領域とクエリフレーム間の局所的同士の特徴マッチングを用いる、新たな半教師あり動画オブジェクトセグメンテーション手法であるRegional Memory Network (RMNet) を提案する。光学フローを用いた領域追跡と局所的マッチングを実行する領域メモリリーダーを活用することで、DAVISおよびYouTube-VOSで最先端の性能を達成するとともに、顕著に高速な推論速度を実現した。

ABSTRACT

Recently, several Space-Time Memory based networks have shown that the object cues (e.g. video frames as well as the segmented object masks) from the past frames are useful for segmenting objects in the current frame. However, these methods exploit the information from the memory by global-to-global matching between the current and past frames, which lead to mismatching to similar objects and high computational complexity. To address these problems, we propose a novel local-to-local matching solution for semi-supervised VOS, namely Regional Memory Network (RMNet). In RMNet, the precise regional memory is constructed by memorizing local regions where the target objects appear in the past frames. For the current query frame, the query regions are tracked and predicted based on the optical flow estimated from the previous frame. The proposed local-to-local matching effectively alleviates the ambiguity of similar objects in both memory and query frames, which allows the information to be passed from the regional memory to the query region efficiently and effectively. Experimental results indicate that the proposed RMNet performs favorably against state-of-the-art methods on the DAVIS and YouTube-VOS datasets.

研究の動機と目的

  • 空間時間的メモリネットワークにおけるグローバル同士のマッチングの限界を是正すること。これは、類似物体に対して不適切なマッチングを引き起こし、計算コストが高くなる。
  • 外観の変化、隠蔽、変形にさらされた状況下でも、局所的オブジェクト領域に注目することで、追跡のロバスト性を向上させること。
  • メモリとクエリフレームの両方の領域にターゲットオブジェクトが含まれる範囲に特徴マッチングの注目を限定することで、特徴マッチングの計算複雑性を低減すること。
  • 効率的な領域追跡と局所的マッチングを用いることで、推論速度を向上させつつ、セグメンテーションの正確性を維持または向上させること。

提案手法

  • 過去のフレームにおけるオブジェクトを含む領域からのみ特徴を保存することで、領域メモリを構築し、関係のない背景特徴を避ける。
  • 隣接フレーム間の光学フロー推定を用いて、以前のマスクを変形し、現在のフレームにおけるクエリ領域の位置を予測する。
  • ワープされたマスクに基づいてクエリ領域を定義するFlow-based Region戦略を適用し、静的または最良マッチング領域よりも高い局所化精度を実現する。
  • メモリとクエリフレームの対応するオブジェクト領域間で局所的同士の特徴マッチングを実行する、領域メモリリーダーを導入する。
  • 推論時間の短縮を図るために、軽量なTinyFlowNetを用いて効率的な光学フロー推定を実施し、正確性を損なわずに実現する。
  • 領域特徴間の類似度スコアを用いてセグメンテーションラベルを割り当て、高いスコアは信頼性の高い予測を示す。

実験結果

リサーチクエスチョン

  • RQ1メモリとクエリフレームのオブジェクト領域間の局所的同士のマッチングは、グローバル同士のマッチングと比較して、類似物体に起因する曚昧さを低減できるか?
  • RQ2メモリとクエリフレームの両方のオブジェクトを含む領域に特徴マッチングを制限することで、計算効率とセグメンテーション正確性が向上するか?
  • RQ3Flowベースの領域予測は、従来の方法と比較して、局所化精度とロバスト性において優れているか?
  • RQ4TinyFlowNetのような軽量な光学フローネットワークは、性能を維持しつつ、推論時間を著しく短縮できるか?
  • RQ5領域メモリと局所的マッチングは、ベンチマークデータセット全体のセグメンテーション性能にどの程度寄与しているか?

主な発見

  • RMNetはDAVIS 2017データセットで平均JIoU 0.810、平均F-measure 0.860を達成し、最先端の手法を上回った。
  • 提案された領域メモリリーダーにより、V100 GPU上での1フレームあたりの特徴マッチング時間が2.09msにまで短縮され、グローバルマッチングと比較して5.5倍の高速化が達成された。
  • Flow-based Regionを用いたクエリ領域予測は平均スコア0.835を達成し、Previous Region (0.792) や Best-match Region (0.819) を上回った。
  • TinyFlowNetをFlowNet2-CSS や RAFT に置き換えても、正確性はほぼ同等(F-measure: 0.860 vs. 0.859)であったが、TinyFlowNet搭載のRMNetはそれぞれ6倍および16倍の高速化が達成された。
  • アブレーションスタディの結果、メモリとクエリフレームの両方で局所的マッチングを実施した場合(M.R. ✓, Q.R. ✓)が最高のパフォーマンス(平均スコア0.835)を示し、局所的同士のマッチングの有効性を裏付けた。
  • 局所的でフロー誘導の領域追跡により、オブジェクトの変形や隠蔽に対してもロバストであり、誤差の蓄積が抑制された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。