Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Video Object Segmentation by Foreground-Background Integration

Zongxin Yang, Yunchao Wei|arXiv (Cornell University)|Mar 18, 2020
Visual Attention and Saliency Detection参考文献 44被引用数 21
ひとこと要約

本論文は、背景の混同を低減するために、前景と背景の特徴埋め込みを同時に学習する新しい半教師あり動画オブジェクトセグメンテーションフレームワークCFBIを提案する。ピクセルレベルおよびインスタンスレベルの埋め込みを共同で統合するコラボラティブエンセンブラーと、バランスの取れたランダムクロップを組み合わせることで、微調整やデータ拡張なしにDAVIS 2016で89.4%(J&F)、DAVIS 2017で81.9%、YouTube-VOSで81.4%の最先端性能を達成した。

ABSTRACT

This paper investigates the principles of embedding learning to tackle the challenging semi-supervised video object segmentation. Different from previous practices that only explore the embedding learning using pixels from foreground object (s), we consider background should be equally treated and thus propose Collaborative video object segmentation by Foreground-Background Integration (CFBI) approach. Our CFBI implicitly imposes the feature embedding from the target foreground object and its corresponding background to be contrastive, promoting the segmentation results accordingly. With the feature embedding from both foreground and background, our CFBI performs the matching process between the reference and the predicted sequence from both pixel and instance levels, making the CFBI be robust to various object scales. We conduct extensive experiments on three popular benchmarks, i.e., DAVIS 2016, DAVIS 2017, and YouTube-VOS. Our CFBI achieves the performance (J$F) of 89.4%, 81.9%, and 81.4%, respectively, outperforming all the other state-of-the-art methods. Code: https://github.com/z-x-yang/CFBI.

研究の動機と目的

  • 半教師あり動画オブジェクトセグメンテーションにおける背景の混同問題に寄与する、類似した背景オブジェクトが前景予測を誤導するのを是正すること。
  • ピクセルレベルおよびインスタンスレベルの特徴埋め込みを統合することで、オブジェクトスケールの変化に対する耐性を向上させること。
  • 訓練中に背景特徴に偏向するのを防ぐために、バランスの取れたランダムクロップ戦略を導入すること。
  • 前景と背景の特徴間の対照性を、暗黙的な対照学習によって向上させること。
  • 微調整や後処理なしに高速な推論(5 FPS)で高い精度を達成すること。

提案手法

  • ピクセルおよびインスタンスレベルの両方で前景および背景埋め込みからの予測を統合するコラボラティブエンセンブラーを提案する。
  • 連続するフレーム間の局所的特徴マッチングを向上させるために、マルチローカルウィンドウマッチングを導入し、耐性を高める。
  • 大規模オブジェクトのセグメンテーションをガイドするためにインスタンスレベルのアテンションを採用し、ピクセル単位の多様性に起因するノイズを低減する。
  • 訓練中にモデルの背景特徴へのバイアスを回避するために、バランスの取れたランダムクロップ戦略を採用する。
  • 直前のフレームからの予測マスクを監督信号として使用することで、時間的整合性を向上させる順次訓練を実装する。
  • それぞれの埋め込みに対して別々のバイアス項を備えた距離メトリックを用いて、前景と背景埋め込み間の対照学習を課す。

実験結果

リサーチクエスチョン

  • RQ1前景と背景の埋め込みを同時に学習することで、半教師あり動画オブジェクトセグメンテーションにおけるセグメンテーション精度が向上するか?
  • RQ2ピクセルレベルおよびインスタンスレベルの埋め込みを統合することで、オブジェクトスケールの変化に対する耐性がどのように向上するか?
  • RQ3前景特徴のみを用いる場合、背景の混同が性能にどの程度悪影響を及えるか?
  • RQ4バランスの取れたランダムクロップ訓練戦略は、モデルの背景属性へのバイアスを低減するか?
  • RQ5複数の埋め込みタイプの共同統合は、セグメンテーション品質の向上にどの程度有効か?

主な発見

  • CFBIはDAVIS 2016で89.4%(J&F)を達成し、微調整やデータ拡張なしに、すべての先行最先端手法を上回った。
  • DAVIS 2017では81.9%(J&F)を達成し、ベースラインのFEELVOS(68.3%)に対して顕著な改善を示した。
  • YouTube-VOSでは81.4%(J&F)を達成し、多様な動画分布にわたる強力な一般化能力を示した。
  • マルチスケールおよびフリップ拡張を適用した場合、DAVIS 2016で90.1%、DAVIS 2017で83.3%、YouTube-VOSで82.7%に性能が向上した。
  • アブレーションスタディの結果、背景埋め込みを削除すると性能が74.9%から70.9%に低下し、混同の低減においてその重要性が裏付けられた。
  • マルチローカルウィンドウおよびインスタンスレベルのアテンションを備えたコラボラティブエンセンブラーは、動的セグメンテーションヘッドベースライン比で1.6%の性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。