Skip to main content
QUICK REVIEW

[論文レビュー] Motion-Attentive Transition for Zero-Shot Video Object Segmentation

Tianfei Zhou, Shunzhou Wang|arXiv (Cornell University)|Mar 9, 2020
Visual Attention and Saliency Detection参考文献 41被引用数 10
ひとこと要約

本稿では、動きと外見特徴を階層的に統合するためのモーション・アテンション・トランジション(MAT)ブロックを用いた、ゼロショット動画オブジェクトセグメンテーションを目的とした新しい二ストリームエンコーダデコーダフレームワーク、MATNetを提案する。各残差段階で動きと外見の処理をインタラーリングすることで、時空間表現学習が向上し、DAVIS-16、FBMS、Youtube-Objectsベンチマークで最先端の性能を達成した。それぞれの平均JIoUスコアは76.1%、76.1%、69.0%であった。

ABSTRACT

In this paper, we present a novel Motion-Attentive Transition Network (MATNet) for zero-shot video object segmentation, which provides a new way of leveraging motion information to reinforce spatio-temporal object representation. An asymmetric attention block, called Motion-Attentive Transition (MAT), is designed within a two-stream encoder, which transforms appearance features into motion-attentive representations at each convolutional stage. In this way, the encoder becomes deeply interleaved, allowing for closely hierarchical interactions between object motion and appearance. This is superior to the typical two-stream architecture, which treats motion and appearance separately in each stream and often suffers from overfitting to appearance information. Additionally, a bridge network is proposed to obtain a compact, discriminative and scale-sensitive representation for multi-level encoder features, which is further fed into a decoder to achieve segmentation results. Extensive experiments on three challenging public benchmarks (i.e. DAVIS-16, FBMS and Youtube-Objects) show that our model achieves compelling performance against the state-of-the-arts.

研究の動機と目的

  • トレーニングアノテーションのない未観測のオブジェクトに一般化できるゼロショット動画オブジェクトセグメンテーションの課題に対処すること。
  • 従来の二ストリームネットワークが動きと外見を独立して処理するため、外見の手がかりに過剰適合してしまうという限界を克服すること。
  • 動きと外見の間の階層的で生物学的にインスパイアされた相互作用をモデル化し、人間の視覚系の注意メカニズムを模倣すること。
  • モーションブラー、変形、背景のごみなどの困難な状況下でもセグメンテーション精度を向上させること。

提案手法

  • 各畳み込み段階で光流を用いて外見特徴の選択的精錬を誘導する非対称アテンション機構を持つ、新規のモーション・アテンション・トランジション(MAT)ブロックを導入する。
  • 動きと外見特徴を各残差ブロックで統合する深くインタラーリングされた二ストリームエンコーダを設計し、継続的なクロスマodal相互作用を可能にする。
  • 多段階エンコーダ特徴の適応的選択と変換を可能にするスケール感受性アテンション(SSA)を備えたブリッジネットワークを採用し、識別性とスケール感受性を向上させる。
  • マルチスケール特徴を活用し、明示的にオブジェクト境界を予測する境界認識強化(BAR)ブロックを段階的に組み込んだデコーダを採用し、セグメンテーション精度を向上させる。
  • スケールごとのエンコーダ・デコーダ特徴のアライメントにSSAを用いるトップダウン型の段階的精錬戦略をデコーダに適用する。
  • トレーニング動画の真値マスクとフレームペアからの推定光流を用いて、モデルをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1動きの手がかりを階層的・マルチスケールな方法で外見ベースの表現学習に効果的に統合することで、ゼロショット動画オブジェクトセグメンテーションの性能を向上させられるか?
  • RQ2ネットワークの各段階で動きと外見のインタラクティブ処理が、二ストリームアーキテクチャの独立処理と比較してどのように優れているか?
  • RQ3動き誘導アテンションは、背景のごみや視覚的類似性によって生じる外見特徴の曖昧さをどの程度軽減できるか?
  • RQ4提案されたMATブロックは、動画シーケンスにおけるモーションブラー、変形、スケール変動に対するロバストネスを向上させるか?
  • RQ5スケール感受性アテンションを備えたブリッジネットワークは、エンコーダとデコーダ間の特徴転送を向上させ、より正確な境界局所化を実現できるか?

主な発見

  • FBMSベンチマークにおいてMATNetは平均JIoU 76.1%を達成し、2番目に良い手法(PDB)を2.1ポイント上回った。
  • DAVIS-16ではMATNetが平均JIoU 76.1%を達成し、2番目に良い手法(AGNN)を1.7ポイント上回った。
  • Youtube-ObjectsではMATNetが平均JIoU 69.0%を達成し、AGSに次ぐ2位となり、ほとんどのオブジェクトカテゴリで一貫した向上が見られた。
  • アブレーションスタディにより、MATブロックが最も重要なコンポonentであることが確認され、その除去または置換により性能が著しく低下した。
  • DAVIS-16およびYoutube-Objectsにおける定性的な結果から、モーションブラー、オブジェクト変形、背景のごみといった困難要因に対しても、モデルは強いロバストネスを示した。
  • スケール感受性アテンション(SSA)を備えた提案されたブリッジネットワークは、エンコーダとデコーダ間の特徴アライメントを顕著に向上させ、より繊細な境界予測に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。