Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning for Semantic Segmentation in Indoor Scenes

Md. Alimoor Reza, Jana Košecká|arXiv (Cornell University)|Jun 3, 2016
Advanced Neural Network Applications参考文献 21被引用数 10
ひとこと要約

本論文では、独立したバイナリーオブジェクト対バックグラウンドセグメンテーションを順序的に組み合わせるための強化学習ベースのアプローチを提案し、NYU-V2データセット上で最先端の手法と同等の性能を達成するとともに、ロボティクス用途におけるモジュラーでタスク特化型かつ段階的学習を可能にする。

ABSTRACT

Future advancements in robot autonomy and sophistication of robotics tasks rest on robust, efficient, and task-dependent semantic understanding of the environment. Semantic segmentation is the problem of simultaneous segmentation and categorization of a partition of sensory data. The majority of current approaches tackle this using multi-class segmentation and labeling in a Conditional Random Field (CRF) framework or by generating multiple object hypotheses and combining them sequentially. In practical settings, the subset of semantic labels that are needed depend on the task and particular scene and labelling every single pixel is not always necessary. We pursue these observations in developing a more modular and flexible approach to multi-class parsing of RGBD data based on learning strategies for combining independent binary object-vs-background segmentations in place of the usual monolithic multi-label CRF approach. Parameters for the independent binary segmentation models can be learned very efficiently, and the combination strategy---learned using reinforcement learning---can be set independently and can vary over different tasks and environments. Accuracy is comparable to state-of-art methods on a subset of the NYU-V2 dataset of indoor scenes, while providing additional flexibility and modularity.

研究の動機と目的

  • セマンティックセグメンテーションにおけるモノリシックなマルチクラスCRFモデルの硬直性に対処し、タスク特化型および段階的ラベル選択を可能にする。
  • セグメンテーションを独立したバイナリープレディクションに分離することで、ロボティクスにおけるモジュラーかつ適応的なセマンティック理解を実現する。
  • 完全なモデルの再トレーニングなしに、新しいセマンティックコンセプトに対する生涯学習と動的適応をサポートする柔軟なフレームワークを開発する。
  • ジョイントマルチクラスCRF最適化ではなく、逐次的ポリシーラーニングによる最適化の効率を向上させることで、トレーニングとインferencingの簡素化を図る。
  • 幾何学的および外観的特徴を統合したバリエガテッドスーパーピクセルを活用することで、より良い領域表現を得ることで、インドアシーンにおける性能を向上させる。

提案手法

  • 各アクションが1つのオブジェクトカテゴリの選択とセグメンテーションに対応するマルコフ決定過程(MDP)として、バイナリーセグメンテーションの逐次的組み合わせを定式化する。
  • 推論中にピクセル単位のジャコーディ指数報酬信号を最大化するポリシーを学習するために、最小二乗ポリシー反復(LSPI)アルゴリズムを用いる。
  • バリエガテッドスーパーピクセルを生成:RGB-Dデータの幾何的フィッティングによる大規模な平面領域と、外観ベースのクラスタリングによる小規模でコンactな領域。
  • ピクセルレベルのアノテーションを用いた教師あり学習により、各オブジェクトカテゴリごとに独立したバイナリーセグメンテーションモデルをトレーニングする。
  • 各ステップで信頼度重み付き統合により、現在のセグメンテーションマップを改善しながら、学習されたポリシーに従ってセグメンテーションを逐次的に組み合わせる。
  • 時系列差分学習を用いてポリシーをエンドツーエンド最適化し、報酬は最終的なセグメンテーションと正解との間のジャコーディ指数として計算する。

実験結果

リサーチクエスチョン

  • RQ1バイナリーセグメンテーションの逐次的ポリシーを学習することで、最先端のマルチクラスCRF手法と同等のセマンティックセグメンテーション精度を達成できるか?
  • RQ2独立したバイナリーセグメンテーションとポリシーに基づく組み合わせというモジュラーなアプローチは、ラベルのタスク特化型サブセットへの適応性を向上させるか?
  • RQ3幾何学的および外観的特徴を統合したバリエガテッドスーパーピクセルの使用は、インドアシーンにおけるセグメンテーション性能にどのように影響するか?
  • RQ4強化学習は、複雑なインドア環境におけるオブジェクト選択とセグメンテーションの最適な順序を効果的に学習できるか?
  • RQ5提案手法は、全モデルの再トレーニングなしに、新しいセマンティックコンセプトの段階的かつ生涯学習をどの程度サポートできるか?

主な発見

  • 提案手法はNYU-V2データセットで競争力ある性能を達成し、'リビングルーム'シーンでは平均ジャコーディ指数68.0%を達成し、Guptaら[9]の最先端手法と同等の性能を示した。
  • キッチンシーンでは、'ベッド'に対して60.5%、'ランプ'に対して34.8%のジャコーディ指数を達成し、一般的なインドアオブジェクトに対して優れた性能を示した。
  • LSPIで学習されたポリシーは、固定順序およびランダム順序のベースラインを上回り、5つのオブジェクトに対して全120通りの順列を列挙して得た最適な組み合わせに近い性能を達成した。
  • リビングルームでは'床'に対して81.3%、'壁'に対して68.0%のジャコーディ指数を達成し、大規模な平面表面に対して優れた性能を示した。
  • バリエガテッドスーパーピクセルの使用により、大規模な構造的表面と小規模でコンパクトなオブジェクトの両方を効果的に捉えることができ、セグメンテーション精度が向上した。
  • モジュラー設計により、関連するラベルにのみ焦点を当てたタスク特化型セグメンテーションが可能であり、性能に悪影響を与えずに、柔軟で適応的なロボットビジョンを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。