Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Act Properly: Predicting and Explaining Affordances from Images

Ching-Yao Chuang, Jiaman Li|arXiv (Cornell University)|Dec 20, 2017
Multimodal Machine Learning Applications参考文献 29被引用数 8
ひとこと要約

本稿では、物理的および社会的例外を含む画像からのアクション・オブジェクトアフォーダンスを予測するためのグラフニューラルネットワーク(GNN)ベースのモデルを提案する。説明と結果を伴う。ADE-Affordanceデータセットを導入し、GNNによる文脈的推論が、特に状況依存制約の処理においてベースライン手法を上回ることを示している。

ABSTRACT

We address the problem of affordance reasoning in diverse scenes that appear in the real world. Affordances relate the agent's actions to their effects when taken on the surrounding objects. In our work, we take the egocentric view of the scene, and aim to reason about action-object affordances that respect both the physical world as well as the social norms imposed by the society. We also aim to teach artificial agents why some actions should not be taken in certain situations, and what would likely happen if these actions would be taken. We collect a new dataset that builds upon ADE20k, referred to as ADE-Affordance, which contains annotations enabling such rich visual reasoning. We propose a model that exploits Graph Neural Networks to propagate contextual information from the scene in order to perform detailed affordance reasoning about each object. Our model is showcased through various ablation studies, pointing to successes and challenges in this complex task.

研究の動機と目的

  • 実世界のシーンにおけるオブジェクトに対して安全で適切な行動を認識できる人工エージェントを実現すること。物理的および社会的制約を考慮する。
  • 状況依存の例外(物理的不可能性や社会的不適切さを含む)を捉えた、新たなデータセット(ADE-Affordance)の収集とアノテーションを行うこと。
  • 視覚的および文脈的ヒントを用いて、アフォーダンスを予測し、特定の行動が不適切な理由を説明し、予想される結果を予測するモデルを開発すること。
  • 視覚的推論におけるアフォーダンス予測の文脈で、グローバルな文脈、オブジェクト特徴、空間的関係の重要性を評価すること。

提案手法

  • モデルはインスタンスレベルのセマンティックセグメンテーションから構築されたシーングラフを用い、ノードがオブジェクトを表し、エッジが空間的隣接関係を符号化する。
  • グラフニューラルネットワーク(GNN)は、隣接ノードからのメッセージの集約によりノード表現を伝搬・更新し、文脈的関係を捉える。
  • オブジェクト特徴はResNet特徴で符号化され、グローバル画像特徴がノード表現を豊かにするために用いられる。
  • 最終的な予測ヘッドは、RNNベースの言語モデルを用いて、アフォーダンスラベル、自然言語の説明、予測される結果を生成する。
  • マルチタスク学習を採用し、アフォーダンス、説明、結果を同時に予測する。GNNパラメータをタスク間で共有することで、効率性を向上させる。
  • アブレーションスタディにより、グローバル文脈、オブジェクトクラス、オブジェクト特徴の寄与度を評価し、最適な性能を得るためのGNN伝搬ステップ数を最適化する。

実験結果

リサーチクエスチョン

  • RQ1物理的不可能や社会的不適切さといった、状況依存のアフォーダンスの例外を視覚的推論でどのようにモデル化できるか?
  • RQ2ローカルオブジェクト特徴と比較して、グローバル画像文脈はアフォーダンス予測にどの程度の役割を果たすか?
  • RQ3統一されたGNNベースのアーキテクチャが、高い性能でアフォーダンス、説明、結果を同時に予測できるか?
  • RQ4オブジェクト間の空間的関係は、アフォーダンス予測の正確性にどのように影響するか?
  • RQ5効果的な視覚的推論のためのGNNにおけるメッセージ伝達ステップ数の最適値は何か?

主な発見

  • 空間的GGNNモデルは、'sit'行動の関係性予測において、平均正解率0.745を達成し、ユニタリーベースラインを上回った。
  • グローバル画像特徴を除去すると、ユニタリーモデルでは性能が著しく低下するが、GNNではそれほど影響を受けない。これは、GNNが局所的文脈をより効果的に活用していることを示している。
  • オブジェクトクラス情報が最も重要な入力であり、これを除去すると性能低下が最大となり、アフォーダンス推論におけるその重要性が浮き彫りになった。
  • GNNにおける伝搬ステップ数T=3でモデルの性能が飽和し、より深いメッセージ伝達が性能向上に寄与しないことが示された。
  • 共有GGNNパラメータを用いたマルチタスク学習は、独立したモデルと同等の性能を達成した。これは、タスク間でのパラメータ共有の可能性を示している。
  • インスタンスセグメンテーションの不完全さがあっても、モデルは視覚的推論タスク全体で妥当な性能を示した。これは、セグメンテーション誤りに対してモデルが頑健であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。