Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Learning via Conditional Motion Propagation

Xiaohang Zhan, Xingang Pan|arXiv (Cornell University)|Mar 27, 2019
Human Pose and Action Recognition参考文献 36被引用数 6
ひとこと要約

本論文は、希少な動きのガイドラインに基づいて単一の画像から密集した光流を予測する自己教師付き学習フレームワーク、条件付き運動伝搬(CMP)を提案する。運動予測を条件付き伝搬タスクとして定式化することにより、明示的な運動モデリングや物体の剛体性に関する強い仮定を必要とせず、力学的に整合性のある構造的特徴を学習し、意味セグメンテーション、インスタンスセグメンテーション、および人間パーツ解析ベンチマークで最先端の性能を達成した。

ABSTRACT

Intelligent agent naturally learns from motion. Various self-supervised algorithms have leveraged motion cues to learn effective visual representations. The hurdle here is that motion is both ambiguous and complex, rendering previous works either suffer from degraded learning efficacy, or resort to strong assumptions on object motions. In this work, we design a new learning-from-motion paradigm to bridge these gaps. Instead of explicitly modeling the motion probabilities, we design the pretext task as a conditional motion propagation problem. Given an input image and several sparse flow guidance vectors on it, our framework seeks to recover the full-image motion. Compared to other alternatives, our framework has several appealing properties: (1) Using sparse flow guidance during training resolves the inherent motion ambiguity, and thus easing feature learning. (2) Solving the pretext task of conditional motion propagation encourages the emergence of kinematically-sound representations that poss greater expressive power. Extensive experiments demonstrate that our framework learns structural and coherent features; and achieves state-of-the-art self-supervision performance on several downstream tasks including semantic segmentation, instance segmentation, and human parsing. Furthermore, our framework is successfully extended to several useful applications such as semi-automatic pixel-level annotation. Project page: "http://mmlab.ie.cuhk.edu.hk/projects/CMP/".

研究の動機と目的

  • 自己教師付き表現学習における運動の本質的曖昧性と複雑性に対処すること。
  • 従来の手法が物体運動に関する強い仮定(例:物体ごとの均一な運動)に依存しているという限界を克服すること。
  • 運動の手がかりを用いて、ラベルなしデータから構造的で一貫性があり、力学的に妥当な視覚的特徴を学習すること。
  • アーチレートドや変形可能な物体を含む多様な物体タイプに一般化可能なフレームワークを開発すること。
  • 手動アノテーションなしで、ガイド付き動画生成や半自動ピクセルレベルのアノテーションといった実用的応用を可能にすること。

提案手法

  • フレームワークは3つのコンponentsで構成される:画像エンコーダ、希少な動きエンコーダ、および密集した動きデコーダ。
  • 訓練中、曇りのない光流から「ウォーターシェッド」戦略を用いて希少な動きガイドラインベクトルをサンプリングし、曇りを低減する。
  • モデルは、これらの希少なガイドラインベクトルを条件として、単一の画像から完全な光流を予測するように訓練される。
  • 条件付き予測タスクにより、画像エンコーダは正確な運動伝搬を支援する力学的に整合性のある表現を学習する。
  • 事前学習中は、一般的な光流推定を監視に用いるが、テスト時にはそれらを必要としない。
  • 推論時、任意のガイドインプットに一般化可能であり、インタラクティブセグメンテーションや動画生成などの応用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1明示的に運動の確率をモデリングしないで、運動の手がかりを有効に活用できる自己教師付き学習フレームワークは存在するか?
  • RQ2希少なガイドラインを用いることで、視覚的表現学習における運動の曇りをどのように解消できるか?
  • RQ3剛体的または均一な物体運動を仮定しないで、ラベルなしデータから力学的に妥当な運動パターンを学習できるか?
  • RQ4条件付き運動伝搬は、セグメンテーションなどの下流ビジョンタスクでの性能向上にどの程度寄与するか?
  • RQ5学習された表現は、ガイド付き動画生成やインタラクティブアノテーションといった実用的応用に拡張可能か?

主な発見

  • CMPは自己教師付き事前学習下でPASCAL VOC 2012意味セグメンテーションで最先端の性能を達成した。
  • ResNet-50をバックボーンとして用いることで、COCOインスタンスセグメンテーションおよびLIP人間パーツ解析ベンチマークでも最先端の結果を達成した。
  • CMPは、カートン、ミラー、ロボットなど、未観測かつレアな物体カテゴリに対しても良好に一般化した。
  • インタラクティブアノテーションでは、Supervised Polygon RNN++法よりも優れた性能を示し、テストセットで25件の失敗を記録したPolygon RNN++と比較して0/170件の失敗を達成した。
  • CMPは、非連結領域や多重連結領域といった困難な物体構造に対しても対応可能であるのに対し、Polygon RNN++はそれらに対処できない。
  • 処理速度はPolygon RNN++より速く(1インスタンスあたり10.2秒対17.6秒)、カテゴリ特化のアノテーションを必要としない無教師で動作する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。