Skip to main content
QUICK REVIEW

[論文レビュー] Recognizing Object Affordances to Support Scene Reasoning for Manipulation Tasks

Fu-Jen Chu, Ruinian Xu|arXiv (Cornell University)|Sep 12, 2019
Robot Manipulation and Learning被引用数 7
ひとこと要約

本稿では、自己注意メカニズムと補助的アフォーダンス属性予測を用いて、未知のオブジェクトカテゴリにわたるゼロショット一般化を可能にするカテゴリに依存しないアフォーダンス認識ネットワーク、AffContextを提案する。本手法は、最先端のアフォーダンスセグメンテーション性能を達成し、目的指向の操作に向けた記号的計画と効果的に統合され、未知のオブジェクトを用いた実世界実験でも88%のタスク達成率を示した。

ABSTRACT

Affordance information about a scene provides important clues as to what actions may be executed in pursuit of meeting a specified goal state. Thus, integrating affordance-based reasoning into symbolic action plannning pipelines would enhance the flexibility of robot manipulation. Unfortunately, the top performing affordance recognition methods use object category priors to boost the accuracy of affordance detection and segmentation. Object priors limit generalization to unknown object categories. This paper describes an affordance recognition pipeline based on a category-agnostic region proposal network for proposing instance regions of an image across categories. To guide affordance learning in the absence of category priors, the training process includes the auxiliary task of explicitly inferencing existing affordances within a proposal. Secondly, a self-attention mechanism trained to interpret each proposal learns to capture rich contextual dependencies through the region. Visual benchmarking shows that the trained network, called AffContext, reduces the performance gap between object-agnostic and object-informed affordance recognition. AffContext is linked to the Planning Domain Definition Language (PDDL) with an augmented state keeper for action planning across temporally spaced goal-oriented tasks. Manipulation experiments show that AffContext can successfully parse scene content to seed a symbolic planner problem specification, whose execution completes the target task. Additionally, task-oriented grasping for cutting and pounding actions demonstrate the exploitation of multiple affordances for a given object to complete specified tasks.

研究の動機と目的

  • オブジェクトカテゴリの事前知識に依存せずに、新規オブジェクトカテゴリにおけるゼロショットアフォーダンス認識を可能にすること。
  • カテゴリ情報とインスタンス特徴学習を分離することで、未知のオブジェクトに対するアフォーダンスセグメンテーションの一般化性能を向上させること。
  • オブジェクトの事前知識が欠如する状況下で、領域提案内でのアフォーダンス属性予測という補助タスクを通じて特徴学習を強化すること。
  • PDDL準拠の状態キーパーを介して、学習済みのアフォーダンスを記号的計画に統合し、目的指向の操作を実現すること。
  • 複数のアフォーダンス(例:切り刻む、叩く)を含む、実世界の操作タスクにおけるフレームワークの評価を行うこと。

提案手法

  • カテゴリに依存しない領域提案ネットワークが、オブジェクトインスタンス領域をオブジェクトカテゴリラベルに依存せずに生成する。
  • 補助的属性予測ヘッドが、各領域提案内に存在するアフォーダンスを推定し、特徴学習をガイドする。
  • 自己注意メカニズムが、各インスタンス領域内のピクセル間の長距離の文脈的依存関係を捉えることで、セグメンテーション精度を向上させる。
  • アフォーダンスセグメンテーションとアフォーダンス属性予測の両タスクを統合したマルチタスク学習により、エンド・ツー・エンドでネットワークを訓練する。
  • 予測されたアフォーダンスを、PDDL準拠の状態キーパーにマッピングして、記号的計画統合を実現する。
  • 順序付けられた目的指向の行動を伴う、実世界の操作タスクにおいて、アフォーダンスベースの計画を用いてシステムを評価する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトカテゴリの事前知識に依存せずに、未知のオブジェクトカテゴリへのアフォーダンス認識が一般化可能か?
  • RQ2カテゴリの監視が欠如する状況下で、補助的アフォーダンス属性予測は特徴学習をどのように向上させるか?
  • RQ3カテゴリに依存しない設定下で、自己注意メカニズムはアフォーダンスセグメンテーション性能をどの程度向上させるか?
  • RQ4AffContextからのアフォーダンス認識は、複雑な目的指向の操作タスクにおける記号的プランナを効果的に駆動できるか?
  • RQ5実世界での実行において、知覚から行動へのパイプラインの性能はどのように低下し、主な誤り要因は何か?

主な発見

  • 本フレームワークは、新規のカテゴリ分割評価プロトコルを用いたUMDデータセットで96%のアフォーダンス認識精度を達成し、先行する最先端手法を上回った。
  • 本フレームワークは、未知のオブジェクトカテゴリを含む11の実世界操作タスクにおいて88%のタスク達成率を示した。
  • 知覚から行動へのパイプラインでは、知覚成功率の94%から実行成功率の83%に11%の性能低下が生じ、主に視覚的推論モジュールの誤りが原因であった。
  • 切り刻む・叩くなどのタスク指向の把持が、1つのオブジェクトに対して複数のアフォーダンスを効果的に活用できることを実証し、複雑な操作の能力を裏付けた。
  • タスク達成率88%は、身体的把握とアフォーダンスに基づく操作分野における既存の研究結果の上位に位置する。
  • 視覚的アフォーダンス知覚と記号的計画の統合がPDDLを介して成功裏に実現され、時間的間隔をあけるタスクに対しても目的指向の操作が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。