Skip to main content
QUICK REVIEW

[論文レビュー] Background subtraction using the factored 3-way restricted Boltzmann machines

Soonam Lee, Daekeun Kim|arXiv (Cornell University)|Feb 5, 2018
Advanced Vision and Imaging参考文献 13被引用数 10
ひとこと要約

本稿では、順次画像からグローバルな運動パターンを学習するための要因分解された3方向制限ボルツマンマシン(RBM)を提案する。この手法により、予測された運動からの逸脱を検出することで、背景差分が可能になる。学習された流れ場を用いて並進と回転をモデル化することで、グローバルな運動に違反する領域としてフォアグラウンドオブジェクトを特定し、従来のコンピュータビジョン手法に依存せずに、ロバストな運動ベースのセグメンテーションを実現する。

ABSTRACT

In this paper, we proposed a method for reconstructing the 3D model based on continuous sensory input. The robot can draw on extremely large data from the real world using various sensors. However, the sensory inputs are usually too noisy and high-dimensional data. It is very difficult and time consuming for robot to process using such raw data when the robot tries to construct 3D model. Hence, there needs to be a method that can extract useful information from such sensory inputs. To address this problem our method utilizes the concept of Object Semantic Hierarchy (OSH). Different from the previous work that used this hierarchy framework, we extract the motion information using the Deep Belief Network technique instead of applying classical computer vision approaches. We have trained on two large sets of random dot images (10,000) which are translated and rotated, respectively, and have successfully extracted several bases that explain the translation and rotation motion. Based on this translation and rotation bases, background subtraction have become possible using Object Semantic Hierarchy.

研究の動機と目的

  • ロボットの3次元環境認識における高次元的かつノイズの多い視覚センサデータから意味のある運動情報を抽出する課題に取り組む。
  • SIFT や HOG といった古典的コンピュータビジョン手法に依存せず、グローバルな運動パターンを学習することで、動画シーケンスにおける背景差分を改善する。
  • ディープベルリーフネットワーク(DBNs)をオブジェクト意味的階層(OSH)フレームワークと統合し、運動に敏感なシーン理解を可能にする。
  • 要因分解された3方向RBMが、画像ペアから並進および回転の基本を抽出できることを示す。

提案手法

  • 2つの連続する画像を可視ユニットとして受け入れるよう、3方向の要因分解RBMを変更し、それらの間の変換をモデル化する。
  • 可視バイアス、隠れ層バイアス、重み行列を用いたエネルギーに基づくモデリングにより、入力と出力の画像ペア間の結合確率分布を学習する。
  • 10,000個のランダムドット画像(並進)と1,000個のMNIST画像(回転)を用いて、運動不変基底を学習する。
  • 各入力画素に対し、最も活性化された出力画素を特定することで最大流れ場(max-flow fields)を抽出し、動きの流れを可視化する。
  • 推論された流れ場を用いて、未知の入力からの出力画像を類推によって再構築し、運動の一般化能力を検証する。
  • グローバルな運動モデルを用いて、OSHフレームワーク内での背景(運動に整合する)とフォアグラウンド(運動に違反する)領域をセグメンテーションする。

実験結果

リサーチクエスチョン

  • RQ1要因分解された3方向RBMは、連続する画像ペアから並進および回転の運動パターンを効果的に学習できるか?
  • RQ2学習された運動流れ場は、グローバルな運動からの逸脱を検出することで、正確な背景差分を可能にするか?
  • RQ3DBNsとOSHフレームワークの統合は、古典的コンピュータビジョン手法と比較して、運動ベースのシーン理解を向上させるか?
  • RQ4モデルは推論された運動場を用いて、未観測の画像を再構築できるか?

主な発見

  • モデルは、2値のランダムドット画像とMNIST画像のシーケンスから、9つの明確な並進パターン(例:上、下、対角線)と360°の回転パターンを効果的に学習した。
  • 最大流れ場は、一様な上向きの運動や円形回転といった、支配的なグローバルな運動方向を明確に可視化し、運動パターン抽出の妥当性を確認した。
  • 推論された運動場を用いて、未知の入力からの出力画像の再構築が正確に実現され、一般化能力が裏付けられた。
  • 予測されたグローバルな運動に違反する領域が、信頼性高くフォアグラウンドとして特定された。これにより、背景差分機構の有効性が検証された。
  • SIFT や HOG といった手作業特徴量に依存せず、データから運動を学習するという点で、従来の手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。