Skip to main content
QUICK REVIEW

[論文レビュー] Beyond One Glance: Gated Recurrent Architecture for Hand Segmentation

Wei Wang, Kaicheng Yu|arXiv (Cornell University)|Nov 27, 2018
Hand Gesture Recognition Systems参考文献 26被引用数 4
ひとこと要約

本論文では、U-Netバックボーンの複数のエンコーダデコーダ層に跨る反復的更新により、セグメンテーションマスクとネットワークの内部状態の両方を改善するゲート付き再帰的アーキテクチャを提案する。複数のハンドセグメンテーションベンチマークで最先端の1ショットおよび単純な再帰的手法を上回り、道路セグメンテーションへの一般化も有効に示し、パラメータ数を少なくして優れた精度を達成する。

ABSTRACT

As mixed reality is gaining increased momentum, the development of effective and efficient solutions to egocentric hand segmentation is becoming critical. Traditional segmentation techniques typically follow a one-shot approach, where the image is passed forward only once through a model that produces a segmentation mask. This strategy, however, does not reflect the perception of humans, who continuously refine their representation of the world. In this paper, we therefore introduce a novel gated recurrent architecture. It goes beyond both iteratively passing the predicted segmentation mask through the network and adding a standard recurrent unit to it. Instead, it incorporates multiple encoder-decoder layers of the segmentation network, so as to keep track of its internal state in the refinement process. As evidenced by our results on standard hand segmentation benchmarks and on our own dataset, our approach outperforms these other, simpler recurrent segmentation techniques, as well as the state-of-the-art hand segmentation one. Furthermore, we demonstrate the generality of our approach by applying it to road segmentation, where it also outperforms other baseline methods.

研究の動機と目的

  • エゴセントリックなハンド解析における1ショットセグメンテーションの限界を、人間の知覚を模倣する反復的精錬によって解消すること。
  • 複数の精錬ステップに跨り、ネットワークの内部状態を維持・更新することで、セグメンテーションの正確性を向上させること。
  • ハンドセグメンテーションを超えて汎用的な再帰的アーキテクチャを構築し、他のセマンティックセグメンテーションタスクへの一般化を示すこと。
  • 将来の研究を支援するため、大規模で公開可能なハンドセグメンテーションデータセット(12.5K枚の画像)を構築すること。

提案手法

  • U-Netの複数のエンコーダデコーダ層に跨る新しいゲート付き再帰ユニット(GRU)を提案し、単一の隠れ層を超えて内部状態の更新を可能にする。
  • 2つのバリエーションを導入:Ours-DRU(Dense Recurrent Unit)とOurs-SRU(Simple Recurrent Unit)、両方とも各精錬ステップでセグメンテーションマスクを入力に含む。
  • ネットワークの内部層を通じて高レベル特徴を伝搬させる再帰的メカニズムを採用し、より深い文脈的精錬を可能にする。
  • ネットワークが画像と以前のマスクを繰り返し処理し、各ステップで内部状態を更新するマルチステージ精錬プロセスを採用する。
  • マサチューセッツ道路データセットを用いて、同アーキテクチャを道路セグメンテーションに適用し、一般化能力を検証する。
  • ImageNetでの事前学習なしに、大規模な事前学習バックボーンを用いる手法と比較可能な学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1セグメンテーションマスクとネットワークの内部状態の両方を精錬する再帰的アーキテクチャは、1ショット手法を上回るハンドセグメンテーション性能を達成できるか?
  • RQ2標準的なRNNやマスクのみの再帰と比較して、複数のエンコーダデコーダ層に跨る再帰の導入は、精錬においてどのように異なるか?
  • RQ3提案されたアーキテクチャは、ハンドセグメンテーションを超えて他のセマンティックセグメンテーションタスクにも一般化可能か?
  • RQ4既存の最先端手法と比較して、パラメータ数を減らしても、最先端の性能を達成できるか?

主な発見

  • Ego-Youtube-Hands(EYTH)データセットでは、提案されたOurs-DRU(4)モデルが平均交差率(mIOU)0.8355を達成し、以前の最先端手法であるRefineNetを上回った。
  • HandOverFace(HOF)データセットでは、小規模なトレーニングセット(198枚)にもかかわらず、2番目の性能を達成し、mIOUは0.784であった。
  • マサチューセッツ道路データセットにおける道路セグメンテーションでは、Ours-DRU(4)がmIOU 0.560およびP/Rスコア0.757を達成し、より大きなVGG19ベースのU-Netとトポロジーに配慮した損失を用いた手法を含むベースラインを上回った。
  • 同等の最先端手法と比較して、パラメータ数が8倍も少ないにもかかわらず、優れた性能を達成しており、高いパラメータ効率性を示している。
  • 可視化比較では、細かい指の分離や隠蔽領域など、困難なケースにおいて、モデルが真値よりも正確な予測を生成していることが示された。
  • アブレーションスタディでは、入力からセグメンテーションマスクを除去すると、EYTHでのmIOUが0.8355から0.8256に低下したが、依然としてRec-Middle(0.814)を上回っており、マスクフィードバックの重要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。