Skip to main content
QUICK REVIEW

[論文レビュー] Video Object Segmentation using Supervoxel-Based Gerrymandering

Brent Griffin, Jason J. Corso|arXiv (Cornell University)|Apr 18, 2017
Visual Attention and Saliency Detection参考文献 32被引用数 5
ひとこと要約

本論文では、3次元時空間的スーパーセル(supervoxels)における局所的および非局所的コンSENSUSを活用することで、前景セグメンテーションを向上させる、新しい教師なし動画オブジェクトセグメンテーション手法「supervoxel gerrymandering」を提案する。動きと顕著性の手がかりを階層的supervoxelクラスタリングと組み合わせることで、DAVISベンチマークで最先端の性能を達成し、多くの教師あり手法および既知のすべての教師なしアプローチを上回る。

ABSTRACT

Pixels operate locally. Superpixels have some potential to collect information across many pixels; supervoxels have more potential by implicitly operating across time. In this paper, we explore this well established notion thoroughly analyzing how supervoxels can be used in place of and in conjunction with other means of aggregating information across space-time. Focusing on the problem of strictly unsupervised video object segmentation, we devise a method called supervoxel gerrymandering that links masks of foregroundness and backgroundness via local and non-local consensus measures. We pose and answer a series of critical questions about the ability of supervoxels to adequately sway local voting; the questions regard type and scale of supervoxels as well as local versus non-local consensus, and the questions are posed in a general way so as to impact the broader knowledge of the use of supervoxels in video understanding. We work with the DAVIS dataset and find that our analysis yields an unsupervised method that outperforms all other known unsupervised methods and even many supervised ones.

研究の動機と目的

  • 局所的および非局所的コンセンサスメカニズムの分析を通じて、supervoxelsが教師なし動画オブジェクトセグメンテーションにどの程度有効であるかを調査すること。
  • 異なるsupervoxel生成手法(SWA、GBH、SG)がセグメンテーションの精度および頑健性に与える影響を評価すること。
  • セグメンテーション性能および時間的安定性の観点から、supervoxelsの最適な階層レベルを特定すること。
  • 学習データや人間によるラベル付けを一切不要とする透明性の高い教師なしフレームワークを構築すること。
  • セグメンテーションを越えた動画理解におけるsupervoxelsの役割に関する一般的な知見を提供すること。

提案手法

  • 動きと視覚的顕著性の手がかりを統合し、統計的外れ値度合いを重みとして用いて、初期の前景度推定値を計算する。
  • 各supervoxel内で、時間にわたるその構成ピクセルの前景度投票を集約することで、局所的コンセンサスを構築する。
  • 空間的・時間的に隣接するsupervoxel間で、局所的コンセンサス値を伝搬・平均化することで、非局所的コンセンサスを確立する。
  • 最終的なセグメンテーションは、局所的および非局所的コンセンサスを組み合わせる投票メカニズムによって決定され、境界の微調整を実現するためのゲリマンディングに類似した手法を採用する。
  • Supervoxel-based Weighted Aggregation (SWA)、Hierarchical Graph-Based (GBH)、Streaming Graph-based (SG) の3つのsupervoxel手法を、複数の設定で評価する。
  • DAVISおよびSegTrackv2ベンチマークを用い、J&F、T、F-measureといった標準指標により性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1動画オブジェクトセグメンテーションにおいて、supervoxels内での局所的コンセンサスと、supervoxelの隣接領域における非局所的コンセンサスの有効性は、どちらが優れているか?
  • RQ2SWA、GBH、SG のうち、どのsupervoxel生成手法が、さまざまな動画特性にわたって最も頑健で正確なセグメンテーションを達成するか?
  • RQ3セグメンテーション精度および時間的安定性の観点から、supervoxelsの最適な階層レベルは何か?
  • RQ4supervoxelコンセンサスを用いた完全に教師なしの手法が、標準ベンチマークで教師あり手法を上回ることができるか?
  • RQ5局所的および非局所的コンセンサスの異なる組み合わせが、データセット全体にわたるセグメンテーション性能にどのように影響を与えるか?

主な発見

  • DAVISデータセットにおいて、SWA 06設定(局所的および非局所的コンセンサスの両方を組み合わせたもの)が、既知のすべての教師なし手法を上回る最高の性能を達成した。
  • 局所的コンセンサスは、特に高階層レベルにおいて、supervoxels内での内部一貫性が強いことから、非局所的コンセンサスよりもより頑健であることが判明した。
  • 階層的グラフベース(GBH)のsupervoxelsは、特にSegTrackv2の可変解像度動画において、最も一貫性のある性能を示した。
  • ストリーミンググラフベース(SG)のsupervoxelsは、SegTrackv2で性能が向上し、ストリーミング性を活かして長時間またはリアルタイム動画処理に最適であることが判明した。
  • 非局所的コンセンサスには、最も低い階層レベルが最も効果的であった。一方、局所的コンセンサスには低~中位の階層レベルが最適であり、複数の階層レベルを含む「All」設定が、全体として最高の結果をもたらした。
  • 時間的安定性(T)はコンセンサスベースの手法で低かったが、局所的コンセンサス手法は非局所的コンセンサス手法よりもフレーム間のセグメンテーションのジャンプが少なかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。