Skip to main content
QUICK REVIEW

[論文レビュー] Fully Convolutional One-Shot Object Segmentation for Industrial Robotics

Benjamin Schnieders, Shan Luo|arXiv (Cornell University)|Mar 2, 2019
Advanced Neural Network Applications被引用数 7
ひとこと要約

本稿では、産業用ロボットにおける1ショットインスタンスセグメンテーションのための完全畳み込み型シアンプスネットワークを提案する。この手法により、1枚のプロトタイプ画像からのみ、新規オブジェクトの高速検出とセグメンテーションが可能になる。マルチタスク学習により訓練されたモデルは、7,000イテレーション後、未学習のオブジェクトに対して平均73%の精度を達成し、最短で4,000イテレーション(57分)で収束する。再訓練後、97.77%の推定成功率でリアルタイムのロボットピッキングが可能になる。

ABSTRACT

The ability to identify and localize new objects robustly and effectively is vital for robotic grasping and manipulation in warehouses or smart factories. Deep convolutional neural networks (DCNNs) have achieved the state-of-the-art performance on established image datasets for object detection and segmentation. However, applying DCNNs in dynamic industrial scenarios, e.g., warehouses and autonomous production, remains a challenging problem. DCNNs quickly become ineffective when tasked with detecting objects that they have not been trained on. Given that re-training using the latest data is time consuming, DCNNs cannot meet the requirement of the Factory of the Future (FoF) regarding rapid development and production cycles. To address this problem, we propose a novel one-shot object segmentation framework, using a fully convolutional Siamese network architecture, to detect previously unknown objects based on a single prototype image. We turn to multi-task learning to reduce training time and improve classification accuracy. Furthermore, we introduce a novel approach to automatically cluster the learnt feature space representation in a weakly supervised manner. We test the proposed framework on the RoboCup@Work dataset, simulating requirements for the FoF. Results show that the trained network on average identifies 73% of previously unseen objects correctly from a single example image. Correctly identified objects are estimated to have a 87.53% successful pick-up rate. Finally, multi-task learning lowers the convergence time by up to 33%, and increases accuracy by 2.99%.

研究の動機と目的

  • スマートファクトリーを含む動的で変化しやすい産業用環境における、ロボットによる迅速なオブジェクト検出とセグメンテーションを実現すること。
  • ディープラーニングにおける長時間の学習時間が課題となる中で、未学習のオブジェクトへの1ショット一般化を可能にする。
  • 弱教師付き特徴クラスタリングフレームワーク内でのマルチタスク学習により、学習時間を短縮し、精度を向上させること。
  • RoboCup@Workデータセットを用いた「未来の工場」シミュレーションを通じて、手法の妥当性を検証すること。
  • 1ショットセグメンテーションが、最小限の遅延で完全に訓練されたセグメンテーションに効果的に移行可能であることを示すこと。

提案手法

  • クエリ画像と1枚のプロトタイプ画像を比較するため、完全畳み込み型シアンプスネットワークアーキテクチャを用い、ピクセル単位のセグメンテーションを実現する。
  • 交差率(IoU)、分類精度、および新規のベクトルスプレッド指標を同時に最適化することで、マルチタスク学習を採用し、収束性と頑健性を向上させる。
  • 手動によるアノテーションを必要とせず、学習済みの特徴表現を自動的に整理する弱教師付きクラスタリング手法を導入する。
  • 実世界の産業用オブジェクトの変動と背景を模倣するRoboCup@Workデータセット上で、ネットワークをエンドツーエンドで訓練する。
  • 新しいオブジェクトの1枚の例画像のみを用いて、ネットワークの完全収束前にもデプロイ可能な迅速な再訓練を可能にする。
  • 未学習のオブジェクトクラスにおけるIoUと分類精度を用いてモデルを評価し、訓練イテレーションの経過に応じた性能の変化を追跡する。

実験結果

リサーチクエスチョン

  • RQ1DCNNは、1つの例からのみ、以前に見たことのない産業用オブジェクトにどの程度セグメンテーション能力を一般化できるか?
  • RQ2マルチタスク学習は、産業用ロボットの1ショットセグメンテーションにおいて、収束速度と分類精度にどのように影響を与えるか?
  • RQ3弱教師付き特徴クラスタリングは、追加のアノテーションを必要とせず、一般化性能を向上させることができるか?
  • RQ4再訓練後、1ショットセグメンテーションの性能は、完全に訓練されたセグメンテーションと比べてどの程度か?
  • RQ5現実のロボット操作タスクにおいて、安定かつデプロイ可能な性能に到達するための最小学習時間はどの程度か?

主な発見

  • 提案フレームワークは、RoboCup@Workデータセット上で7,000イテレーション経過後、未学習のオブジェクトを平均73個正しくセグメンテーションしている。
  • マルチタスク学習により、モデルは最短で4,000イテレーション(NVIDIA 1080 Tiで約57分)で収束し、単一タスク学習と比較して収束時間を最大33%短縮した。
  • マルチタスク学習は、単一タスクベースラインと比較して分類精度を2.99%向上させた。
  • 全データで完全な再訓練を実施した後、分類精度は94%に達し、正しく識別されたオブジェクトのピッキング成功率は97.77%と推定された。
  • IoU、精度、ベクトルスプレッド、セグメンテーションの4つのタスクを同時に学習させた場合、タスク数を減らした場合と比較して収束が早く、誤差も低かった。
  • 多様な産業用オブジェクトを含むスパニングセットで学習させたことで、特定の訓練詳細に過剰適合することを最小限に抑え、新規オブジェクトクラスへの頑健な一般化を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。