Skip to main content
QUICK REVIEW

[論文レビュー] U-Net Based Multi-instance Video Object Segmentation

Heguang Liu, Jingle Jiang|arXiv (Cornell University)|May 19, 2019
Advanced Image and Video Retrieval Techniques参考文献 15被引用数 6
ひとこと要約

本稿では、インスタンス分離と重み付き交差エントロピーおよびDice係数のハイブリッド損失を活用した、U-Netベースの完全畳み込みネットワークを、マルチインスタンス動画オブジェクトセグメンテーションに提案する。DAVIS 2017ではF mean: 0.467およびJ mean: 0.424を達成し、ベースラインモデルに比べて再現率と輪郭の滑らかさが優れており、特に完全なインスタンスカバレッジを要する状況で顕著な性能を示す。

ABSTRACT

Multi-instance video object segmentation is to segment specific instances throughout a video sequence in pixel level, given only an annotated first frame. In this paper, we implement an effective fully convolutional networks with U-Net similar structure built on top of OSVOS fine-tuned layer. We use instance isolation to transform this multi-instance segmentation problem into binary labeling problem, and use weighted cross entropy loss and dice coefficient loss as our loss function. Our best model achieves F mean of 0.467 and J mean of 0.424 on DAVIS dataset, which is a comparable performance with the State-of-the-Art approach. But case analysis shows this model can achieve a smoother contour and better instance coverage, meaning it better for recall focused segmentation scenario. We also did experiments on other convolutional neural networks, including Seg-Net, Mask R-CNN, and provide insightful comparison and discussion.

研究の動機と目的

  • リアルタイム処理を実現するため、時間的情報を使用しないマルチインスタンス動画オブジェクトセグメンテーションの課題に対処すること。
  • 既存の最先端手法(例:OSVOS)と比較して、セグメンテーションの完全性と輪郭の滑らかさを向上させること。
  • DAVIS 2017ベンチマーク上で、U-Net、SegNet、Mask R-CNNといった完全畳み込みアーキテクチャを評価・比較すること。
  • マルチインスタンスセグメンテーションに有効な損失関数およびインスタンス分離戦略を調査すること。

提案手法

  • エンコーダー特徴量からの空間的詳細を保持するために、スキップ接続を備えたU-Netに類似したアーキテクチャを採用する。
  • マルチインスタンスマスクを1インスタンスあたり1つのバイナリマスクに変換することで、インスタンス分離を実施し、問題をN個の独立したバイナリセグメンテーションタスクに変換する。
  • クラスの不均衡を是正し、IoUを向上させるために、重み付き交差エントロピーとDice係数のハイブリッド損失関数を採用する。
  • 最初のフレームからのOSVOS最適化特徴量を微調整に用いることで、新しい動画シーケンスへのワンショット適応を可能にする。
  • GPUメモリ制限のためバッチサイズは8に設定され、1モデルあたり8時間の収束に要する。
  • 標準指標(F meanおよびJ mean)を用いて、DAVIS 2017テストセット上でモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1時間的情報を使用しないU-Netベースのアーキテクチャは、マルチインスタンス動画オブジェクトセグメンテーションで競争力のある性能を達成できるか?
  • RQ2バイナリマスクへのインスタンス分離は、エンドツーエンドのマルチクラス予測と比較して、セグメンテーションの正確性と完全性にどのような影響を与えるか?
  • RQ3重み付き交差エントロピーとDice係数の損失を組み合わせることで、小規模オブジェクトのセグメンテーションにおけるクラスの不均衡問題にどのような効果があるか?
  • RQ4OSVOSおよびMask R-CNNやSegNetなどの他のアーキテクチャと比較して、提案モデルの性能およびアノテーション品質はいかがなっているか?
  • RQ5特にオクルージョンやオブジェクト境界の損失が生じる状況下での、モデルの失敗モードは何か?

主な発見

  • 提案されたU-Netベースのモデルは、DAVIS 2017データセットでF mean: 0.467およびJ mean: 0.424を達成し、最先端のOSVOSと同等の性能を示した。
  • OSVOSよりも滑らかな輪郭とより良いインスタンスカバレッジを実現しており、再現率中心のセグメンテーションタスクに適している。
  • ドリフトチカンのシーケンスで、遠くにいる旋回する車両の例から、大規模な動きや外観の変化に対しても良好な対応を示した。
  • マルチインスタンスのオクルージョンでは、1つのオブジェクトが他方の前面に来る際に、両方のオブジェクトを追跡してしまうことが多く、カメルシーケンスで顕著に観察された。
  • オブジェクトが画像境界から出て再び入ってくると、トラッキングを失うことがあり、モトクロスジャンプシーケンスで確認された。
  • Mask R-CNNは、未学習のクラス(例:ラクダを馬と誤認)への一般化が不十分であり、最初のフレームの監視情報を効果的に統合できなかったため、失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。