Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised part representation by Flow Capsules

Sara Sabour, Andrea Tagliasacchi|arXiv (Cornell University)|Nov 27, 2020
Image Processing and 3D Reconstruction参考文献 40被引用数 18
ひとこと要約

本稿では、動きを自己教師信号として用いる非教師付き手法FlowCapsulesを提案する。FlowCapsulesは、動画フレーム間の光学フローと深度順序のモデリングを活用し、物体部品のプライマリーキャプセル表現を学習する。この手法により、分離された形状マスクを発見し、隠蔽領域を推定でき、複雑で装飾的なシーンにおいても、従来手法を上回る非教師付き部品セグメンテーションおよび画像分類性能を達成する。

ABSTRACT

Capsule networks aim to parse images into a hierarchy of objects, parts and relations. While promising, they remain limited by an inability to learn effective low level part descriptions. To address this issue we propose a way to learn primary capsule encoders that detect atomic parts from a single image. During training we exploit motion as a powerful perceptual cue for part definition, with an expressive decoder for part generation within a layered image model with occlusion. Experiments demonstrate robust part discovery in the presence of multiple objects, cluttered backgrounds, and occlusion. The part decoder infers the underlying shape masks, effectively filling in occluded regions of the detected shapes. We evaluate FlowCapsules on unsupervised part segmentation and unsupervised image classification.

研究の動機と目的

  • 教師なし条件下で、キャプセルネットワークが有効な低レベル部品記述子を学習できないという限界を解決すること。
  • 動きを知覚的手がかりとして用い、単一画像から原子的な視覚的部品を非教師付きで発見できること。
  • 遮蔽、ごみ、テクスチャの変動が生じる状況下でも、部品セグメンテーションおよび形状補完を向上させること。
  • キャプセルベースの生成モデルにおいて、形状、ポーズ、深度順序を分離可能にすること。
  • 現実世界および合成データセットにおいて、既存の非教師付き部品発見手法を上回ること。

提案手法

  • 連続する動画フレーム間の光学フローを推定するためのシアン・ネットワークを、キャプセルのポーズを教師信号として訓練する。
  • キャプセルエンコーダーは、1枚の画像を、それぞれが標準形状マスク、3次元ポーズ(並進、回転)および深度スカラーを持つプライマリーキャプセルの集合にマッピングする。
  • 微分可能なデコーダーは、キャプセルパラメータから画像フレームを生成し、深度順序に基づくレイヤー構成により遮蔽をモデル化する。
  • 予測されたキャプセルの運動と観測された光学フローの整合性を強制する、フロー再構成損失を用いる。
  • 遮蔽の処理を改善するために、デコーダーで明示的に深度順序をモデル化する。
  • 教師付きマスクやラベルを一切使用せず、動画フレームのみを用いて、エンドツーエンドで自己教師学習を行う。

実験結果

リサーチクエスチョン

  • RQ1動画フレーム間の動きが、非教師付き設定下で意味のある視覚的部品を発見する有効な自己教師信号として機能するか。
  • RQ2深度順序を組み込んだキャプセルベース表現が、形状補完および遮蔽に対する耐性を向上させられるか。
  • RQ3ごみやテクスチャの変動下で、画像再構成ベースの手法と比較して、部品セグメンテーションおよび分類性能にどのような差が生じるか。
  • RQ4教師なし条件下で、モデルがどの程度形状、ポーズ、深度を分離可能にしているか。
  • RQ5本手法は、多様な物体カテゴリおよび複雑なシーンに一般化可能か。

主な発見

  • FlowCapsulesはGeoデータセットで94%のIoU、Geo+で88%のIoU(16個のキャプセル)を達成し、非教師付き部品セグメンテーションにおいてPSDおよびSCAEを上回った。
  • 符号化長を短縮しても(例:|s_k|=3のとき91% IoU)、高い性能を維持しており、コンactな形状表現に対する頑健性を示した。
  • 深度順序を省略すると性能が著しく低下(54% IoUに)し、遮蔽処理においてその重要性が明確になった。
  • 深さ6層のデコーダーは、特に円形の形状においてマスクの滑らかさとIoUを向上させ、アーキテクチャ的利点を示した。
  • CIFAR-100ではk-meansクラスタリングを用いて85.3%の非教師付き画像分類精度を達成し、SCAEを上回った。
  • 部分が1フレーム内に完全に表示されていなくても、遮蔽された領域を補完する形状マスクを効果的に推定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。