Skip to main content
QUICK REVIEW

[論文レビュー] BusyHands: A Hand-Tool Interaction Database for Assembly Tasks Semantic Segmentation

Roy Shilkrot, Zhi Chai|arXiv (Cornell University)|Feb 19, 2019
Advanced Neural Network Applications参考文献 29被引用数 5
ひとこと要約

本稿では、組立作業における複雑なハンドツールインタラクションシーンにおける意味的セグメンテーションを進めるために、16の意味的クラス(手、工具、作業部品など)をラベル付けした、7,905枚の実写および合成画像からなる新しいRGB+DデータセットBusyHandsを紹介する。このデータセットにより、最先端のモデルのベンチマークが可能となり、実データと合成データを組み合わせることで、実データのみで学習した場合に比べてmIOUが最大80%向上することが示された。

ABSTRACT

Visual segmentation has seen tremendous advancement recently with ready solutions for a wide variety of scene types, including human hands and other body parts. However, focus on segmentation of human hands while performing complex tasks, such as manual assembly, is still severely lacking. Segmenting hands from tools, work pieces, background and other body parts is extremely difficult because of self-occlusions and intricate hand grips and poses. In this paper we introduce BusyHands, a large open dataset of pixel-level annotated images of hands performing 13 different tool-based assembly tasks, from both real-world captures and virtual-world renderings. A total of 7906 samples are included in our first-in-kind dataset, with both RGB and depth images as obtained from a Kinect V2 camera and Blender. We evaluate several state-of-the-art semantic segmentation methods on our dataset as a proposed performance benchmark.

研究の動機と目的

  • 組立作業における人間の手と工具のインタラクションを対象とした大規模で完全にラベル付けされた意味的セグメンテーション用データセットの不足に対処すること。
  • 複雑で現実的かつ合成的なハンドツールインタラクションシーンを対象とした、深層学習モデルの訓練と評価を支援するベンチマークデータセットを提供すること。
  • 産業的および個人の製造環境における、頑健で汎化性の高い意味的セグメンテーションモデルの研究を可能にすること。
  • 合成データ拡張の有効性が、現実世界のハンドツールインタラクションデータにおけるセグメンテーション性能向上に与える影響を調査すること。

提案手法

  • データセットは、Kinect V2で撮影した7,905組のRGBおよび深度画像ペアから構成され、Blenderを用いてレンダリングされたもので、13のツールを用いた組立作業をカバーしている。
  • 手動および自動のラベリングパイプラインを用いて、手、工具(例:スクリュードライバー、レンチ)、作業部品、背景を含む16の意味的クラスについてピクセル単位のラベル付けが行われた。
  • 実世界の撮影データと合成レンダリングデータを含んでおり、合成データは3次元モデリングおよびフォトリッチなレンダリングにより生成され、多様性とスケーラビリティを向上させた。
  • FRRN、DeepLabV3+、MobileUNet、SegNetなどの最先端の意味的セグメンテーションモデルを用いて、mIOUを主な指標として比較評価を実施した。
  • ドメインの一般化性とデータ効率性を評価するために、データ分割ごとにトレーニング戦略を検証した:実データのみ、合成データのみ、実データ+合成データの混合。
  • ノイズ低減のための後処理技術(例:ボーブジオメトリの解析)を検討したが、主な実験では適用しなかった。

実験結果

リサーチクエスチョン

  • RQ1実データのみで学習した場合と合成データのみで学習した場合とで、意味的セグメンテーションモデルの性能はどのように異なるか?
  • RQ2実データと合成データを組み合わせることで、実データのテストセットにおけるセグメンテーション精度はどの程度向上するか?
  • RQ3異なる最先端のアーキテクチャは、ハンドツールインタラクションの典型的な複雑で遮蔽されやすくごちゃついたシーンにおいて、どのように性能を発揮するか?
  • RQ4深度モダリティ(RGB+D)は、ハンドツールインタラクションシーンにおけるセグメンテーション精度にどのような影響を与えるか?
  • RQ5合成データは現実世界のシナリオに効果的に一般化可能か?その限界は何か?

主な発見

  • FRRN-Bモデルが全カテゴリで最高のmIOUを達成し、DeepLabV3+ や SegNet-Skip などの他のアーキテクチャを上回った。
  • 実データと合成データの両方で学習させた場合、実データテストセットのmIOUは、実データのみ(FRRN-A)の0.336から0.502に上昇し、相対的に50%の向上が達成された。
  • 合成データによる性能向上はほとんどのモデルで一貫しており、mIOUは最大80%の向上が見られたが、MobileUNetでは性能がわずかに低下した。
  • 手、工具、四肢のセグメンテーションは一般的に正確であったが、ランダムなテーブル上の物体が頻繁に工具として誤分類されたため、予測にノイズが存在することが示された。
  • 深度データの導入により、COCO や ADE20K などのデータセットと比較して、mIOUが高く、境界の正確性も向上した。
  • 合成データのみで学習させた場合でも高いmIOU(FRRN-Aで0.714)を達成しており、実データと組み合わせることでドメイン一般化の強力な可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。