Skip to main content
QUICK REVIEW

[論文レビュー] Anchor Diffusion for Unsupervised Video Object Segmentation

Zhao Yang, Qiang Wang|arXiv (Cornell University)|Oct 24, 2019
Visual Attention and Saliency Detection参考文献 67被引用数 21
ひとこと要約

本稿では、非局所的なアテンション機構を用いて参照フレームと現在のフレーム間の画素単位の類似性を学習することで、長時間にわたる時間的依存関係をモデル化する、新しい非教師あり動画オブジェクトセグメンテーション手法であるAnchor Diffusion Network (AD-Net) を提案する。再帰型ネットワークやオプティカルフローを用いないにもかかわらず、DAVIS-2016で81.7%の平均IoUを達成し、従来の非教師あり手法を2.2%上回り、長時間にわたるずれにも強い。

ABSTRACT

Unsupervised video object segmentation has often been tackled by methods based on recurrent neural networks and optical flow. Despite their complexity, these kinds of approaches tend to favour short-term temporal dependencies and are thus prone to accumulating inaccuracies, which cause drift over time. Moreover, simple (static) image segmentation models, alone, can perform competitively against these methods, which further suggests that the way temporal dependencies are modelled should be reconsidered. Motivated by these observations, in this paper we explore simple yet effective strategies to model long-term temporal dependencies. Inspired by the non-local operators of [70], we introduce a technique to establish dense correspondences between pixel embeddings of a reference "anchor" frame and the current one. This allows the learning of pairwise dependencies at arbitrarily long distances without conditioning on intermediate frames. Without online supervision, our approach can suppress the background and precisely segment the foreground object even in challenging scenarios, while maintaining consistent performance over time. With a mean IoU of $81.7\%$, our method ranks first on the DAVIS-2016 leaderboard of unsupervised methods, while still being competitive against state-of-the-art online semi-supervised approaches. We further evaluate our method on the FBMS dataset and the ViSal video saliency dataset, showing results competitive with the state of the art.

研究の動機と目的

  • 再帰的またはフローに基づく時間的モデリングによって引き起こされる、非教師あり動画オブジェクトセグメンテーションにおける長期的ずれや誤差の蓄積を解消すること。
  • RNN やオプティカルフローに基づく複雑なモデルと比較して、単純な非逐次的手法が非教師ありVOSで優れた性能を発揮できるかどうかを検証すること。
  • 遠く離れたフレーム間の密集した長距離の画素レベルの対応関係が、背景を効果的に抑制し、前景オブジェクトをセグメンテーションするのに有効かどうかを調査すること。
  • 非教師ありおよびサリエンシー検出設定下で、DAVIS-2016、FBMS、ViSalを含む複数のベンチマークにおける一般化性能を評価すること。

提案手法

  • 本手法は、その画素埋め込みを用いて現在のフレームの埋め込みと密な類似性を計算するための1つの参照フレーム(「アンカー」フレーム)を用いる。
  • 非局所的なアテンション機構を用いて、アンカー・フレームの画素と現在のフレームのすべての画素との間のペアワイズ類似性を計算し、長距離の依存関係モデリングを可能にする。
  • 類似性マップを用いて特徴をアグリゲートし、セグメンテーションマスクを生成する。前景オブジェクトは、その空間的範囲にわたり一貫した高い類似性によって強調される。
  • アンカー・フレームを任意の現在のフレームと直接関連付けることで、逐次処理を回避し、時間的な誤差伝搬を排除する。
  • エンタープライズで学習するために、対照的損失を用い、アンカー内の前景画素が現在のフレームの対応する画素と高い類似性を持つように促進する。
  • 推論時にはオンラインファインチューニングや後処理を必要とせず、リアルタイムかつ頑健なセグメンテーションを実現する。

実験結果

リサーチクエスチョン

  • RQ1再帰的でなく、アテンションに基づく手法が、RNN やオプティカルフローに基づく非教師ありVOS手法を上回れるか?
  • RQ2固定されたアンカー・フレームと現在のフレームとの間の画素単位の密な類似性を学習することで、非教師あり動画セグメンテーションにおける長期的ずれが軽減されるか?
  • RQ3長距離アテンションを備えた単純な静的画像セグメンテーションモデルが、複雑な再帰的またはフローに基づくアーキテクチャを上回れるか?
  • RQ4提案手法は、ViSal や FBMS のような動画サリエンシーのベンチマークに対してどの程度一般化できるか?

主な発見

  • DAVIS-2016の非教師ありVOSベンチマークで、AD-Netは81.7%の平均IoUを達成し、非教師あり手法の中で最高順位にランクされ、前回のSOTAを2.2%上回った。
  • FBMSデータセットでは、すべての手法の中で最高のF-measureと最低のMAEを達成し、強力な一般化性能と頑健性を示した。
  • ViSalサリエンシーベンチマークでは、MAEが最も低く(0.030)、60%の再現率までほぼ完璧な精度を維持し、既存のサリエンシー・モデルを上回った。
  • サリエンシー検出用に訓練されていないにもかかわらず、DAVISおよびFBMSのサリエンシー指標においてSOTAの性能を達成したため、強力な転移性が示された。
  • 外観の変化や運動の不連続性があっても、長時間にわたる動画シーケンスにおいて一貫した性能を維持し、最小限のずれを示した。
  • アブレーションスタディにより、非局所アテンション機構が長距離モデリングにおいて極めて重要であり、その除去により性能が著しく低下することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。