Skip to main content
QUICK REVIEW

[論文レビュー] Geometry-Aware Recurrent Neural Networks for Active Visual Recognition

Ricson Cheng, Ziyan Wang|arXiv (Cornell University)|Nov 3, 2018
Advanced Vision and Imaging被引用数 16
ひとこと要約

本稿では、3次元シーン再構築と隠蔽の推論に基づいて最適なカメラビューを選択する方策ネットワークを用いる、アクティブビジョアルティファクチャ認識のための幾何学的注意型再帰ニューラルネットワークを提案する。2次元および3次元畳み込みをGRUベースのメモリモジュールと統合することで、ベースライン比で最大25%の3次元IoU向上を達成し、知的な軌道計画により隠蔽を能動的に低減することで、固定およびランダムなビュー方策を上回る性能を発揮する。

ABSTRACT

We present recurrent geometry-aware neural networks that integrate visual information across multiple views of a scene into 3D latent feature tensors, while maintaining an one-to-one mapping between 3D physical locations in the world scene and latent feature locations. Object detection, object segmentation, and 3D reconstruction is then carried out directly using the constructed 3D feature memory, as opposed to any of the input 2D images. The proposed models are equipped with differentiable egomotion-aware feature warping and (learned) depth-aware unprojection operations to achieve geometrically consistent mapping between the features in the input frame and the constructed latent model of the scene. We empirically show the proposed model generalizes much better than geometryunaware LSTM/GRU networks, especially under the presence of multiple objects and cross-object occlusions. Combined with active view selection policies, our model learns to select informative viewpoints to integrate information from by "undoing" cross-object occlusions, seamlessly combining geometry with learning from experience.

研究の動機と目的

  • 固定またはランダムな軌道に依存するのではなく、能動的に最適なカメラビューを選択することで3次元ビジョナルティファクチャ認識を向上させること。
  • 過去の観測を記憶するメモリを保持する再帰的アーキテクチャを用いて、シーンの幾何構造と隠蔽ダイナミクスをモデル化すること。
  • 順次意思決定を通じて視点依存の隠蔽を最小化する方策を学習することで、3次元再構築の精度を向上させること。
  • RGB、深度、カメラポーズのマルチモodal入力を統合的に3次元再構築およびセグメンテーションフレームワークに統合すること。
  • LSTMベースのベースラインおよび非アクティブ方策と比較して、3次元IoUおよびセグメンテーション品質の優れた性能を示すこと。

提案手法

  • 方策ネットワークは、RGB画像に2次元畳み込みを、特徴ボクセルに3次元畳み込みを適用して、ビュー選択のための空間的・時系列的特徴を抽出する。
  • GRUベースのメモリモジュールは、複数のビューにわたる特徴を統合する隠れ状態を維持し、シーン幾何構造に関する順次的推論を可能にする。
  • 連結された特徴を入力として、多層パーセプトロンを用いて8つの可能なカメラ移動方向のカテゴリカル分布を出力する。
  • スキップ接続を備えた3次元U-Netアーキテクチャを用いてエンドツーエンドの3次元再構築を実現し、シグモイド交差エントロピー損失で訓練する。
  • 深度推定とマスク推定は、逆深度にL2損失、マスクにバイナリ交差エントロピー損失を適用した2次元U-Netで行う。
  • RGB、深度、カメラポーズの特徴は、fuserモジュールで統合され、その後LSTMベースのアグレゲータおよび3次元デコーダに渡される。

実験結果

リサーチクエスチョン

  • RQ1再帰的方策ネットワークは、シーンの幾何構造と隠蔽に基づいて能動的にカメラビューを選択することで、3次元再構築を向上させることができるか?
  • RQ23次元特徴メモリと2次元視覚入力の統合は、ビュー選択性能にどのような影響を与えるか?
  • RQ33次元IoUおよび再構築品質の観点で、アクティブなビュー選択は固定、ランダム、または一方通行の軌道方策を上回るか?
  • RQ4知的な軌道計画により、隠蔽の影響をどの程度低減できるか?
  • RQ5本手法は、複数オブジェクトや屋内環境を含む複雑なシーンにどの程度一般化できるか?

主な発見

  • 提案されたアクティブ方策は、単一ビュー予測と比較して3次元IoUを相対的に25%向上させ、固定およびランダムなビュー方策を著しく上回った。
  • 図2および図3の可視化結果から、以前に隠れていた領域を「解消」するような軌道を選択することで、隠蔽の影響が低減されていることが裏付けられた。
  • 複数オブジェクトシーンでは、LSTMベースラインと比較して平均IoUが18%向上し、再構築品質が向上した。
  • 3次元U-Net再構築モデルは高精細なボクセル予測を達成し、図4の定性的な結果から構造的一致性と詳細が向上していることが示された。
  • 図5の3次元セグメンテーション結果から、本手法は正確なインスタンスレベルの予測を生成し、正解に近い結果を示した。
  • SUNCGデータセットのサブシーンにおいて、モデルは良好に一般化し、図6に示すように一貫性があり詳細な3次元再構築を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。