[論文レビュー] Learning Semantic Segmentation with Weakly-Annotated Videos
本論文では、弱教師あり動画から動きの手がかりを活用し、ピクセルレベルのアノテーションを必要とせずに最先端のセマンティックセグメンテーション性能を達成する、完全畳み込みニューラルネットワークであるmotion-CNN(M-CNN)を提案する。わずか150件の弱教師あり動画アノテーションで訓練されたM-CNNは、数千枚の強教師あり画像で訓練された手法と同等の性能を達成し、PASCAL VOC 2012およびYouTube-Objectsで先行する弱教師ありアプローチを上回る。
Fully convolutional neural networks (FCNNs) trained on a large number of images with strong pixel-level annotations have become the new state of the art for the semantic segmentation task. While there have been recent attempts to learn FCNNs from image-level weak annotations , they need additional constraints, such as the size of an object, to obtain reasonable performance. To address this issue, we present motion-CNN (M-CNN), a novel FCNN framework which incorporates motion cues and is learned from video-level weak annotations. Our learning scheme to train the network uses motion segments as soft constraints, thereby handling noisy motion information. When trained on weakly-annotated videos, our method outperforms the state-of-the-art EM-Adapt approach on the PASCAL VOC 2012 image segmentation benchmark. We also demonstrate that the performance of M-CNN learned with 150 weak video annotations is on par with state-of-the-art weakly-supervised methods trained with thousands of images. Finally, M-CNN substantially outperforms recent approaches in a related task of video co-localization on the YouTube-Objects dataset. This is an extended version of our ECCV 2016 paper.
研究の動機と目的
- オブジェクトサイズのような追加制約を必要とする弱教師ありセマンティックセグメンテーション手法の制限を解消すること。
- ピクセルレベルの監督を必要とせずに、動画レベルの弱教師ありアノテーションからの動きの手がかりが、セマンティックセグメンテーションを効果的にガイドできるかを検討すること。
- ピクセルレベルのアノテーションに依存するのを減らすために、単一の動画レベルラベルのみを用いて高い性能を達成するフレームワークを開発すること。
- 弱教師あり学習を用いて、画像レベルのセマンティックセグメンテーションおよび動画共同局在タスクの両方の性能を向上させること。
提案手法
- M-CNNは、動画レベルの弱教師ありアノテーションを用いてエンドツーエンドで訓練される完全畳み込みニューラルネットワークである。
- 動画から抽出された動きセグメントが、訓練中にソフト制約として用いられ、ネットワークが正確な空間局在を目指すように誘導される。
- フレームワークは動画内の時間的整合性を活用して、妥当なオブジェクト境界とセマンティックレイアウトを推定する。
- 動きに敏感な監視を段階的に適用するマルチステージ訓練戦略を採用し、予測を段階的に精緻化する。
- 動きセグメント間での活性化の一貫性を促進する損失関数を組み込み、信頼性の低い動きの手がかりに起因するノイズを低減する。
- ボクシングボックスやピクセルレベルマスクを必要としない弱教師ありの目的関数を用いて訓練される。
実験結果
リサーチクエスチョン
- RQ1弱教師あり動画からの動きの手がかりが、ピクセルレベルのアノテーションを一切不要としてセマンティックセグメンテーション性能を向上させられるか?
- RQ2M-CNNは、精度とデータ効率の観点から、既存の弱教師あり手法と比較してどのように差をつけるか?
- RQ3M-CNNは、動画レベルのラベルのみを用いて、動画共同局在などの関連タスクに一般化可能か?
- RQ4150件の弱教師あり動画アノテーションで訓練されたモデルが、数千枚の強教師あり画像で訓練されたモデルの性能にどの程度近づけるか?
主な発見
- 弱教師あり動画で訓練されたM-CNNは、PASCAL VOC 2012の画像セグメンテーションベンチマークでEM-Adapt手法を上回る性能を示した。
- わずか150件の弱教師あり動画アノテーションで訓練されたM-CNNは、数千枚の画像で訓練された最先端の弱教師あり手法と同等の性能を達成した。
- YouTube-Objectsデータセットにおける動画共同局在タスクにおいて、M-CNNは最近の手法を著しく上回った。
- 動きセグメントをソフト制約として用いることで、動き情報のノイズが効果的に低減され、局在精度が向上した。
- モデルは画像および動画レベルの弱教師ありタスクの両方において、強力な一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。