Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-Guided Recurrent Neural Network Learning for Task-Oriented Action Prediction

Liang Lin, Lili Huang|arXiv (Cornell University)|Jul 15, 2017
Human Pose and Action Recognition参考文献 14被引用数 4
ひとこと要約

本稿では、時間的And-Orグラフ(AOG)を用いて合成学習データを生成し、アノテート済み例への依存度を低減することで、タスク指向の行動予測のための知識誘導型再帰的LSTMネットワークを提案する。この手法は、平均92%のシーケンス正解率と未学習の関連タスクで73.05%の正解率を達成し、優れた一般化性能とデータ効率性を示している。

ABSTRACT

This paper aims at task-oriented action prediction, i.e., predicting a sequence of actions towards accomplishing a specific task under a certain scene, which is a new problem in computer vision research. The main challenges lie in how to model task-specific knowledge and integrate it in the learning procedure. In this work, we propose to train a recurrent long-short term memory (LSTM) network for handling this problem, i.e., taking a scene image (including pre-located objects) and the specified task as input and recurrently predicting action sequences. However, training such a network usually requires large amounts of annotated samples for covering the semantic space (e.g., diverse action decomposition and ordering). To alleviate this issue, we introduce a temporal And-Or graph (AOG) for task description, which hierarchically represents a task into atomic actions. With this AOG representation, we can produce many valid samples (i.e., action sequences according with common sense) by training another auxiliary LSTM network with a small set of annotated samples. And these generated samples (i.e., task-oriented action sequences) effectively facilitate training the model for task-oriented action prediction. In the experiments, we create a new dataset containing diverse daily tasks and extensively evaluate the effectiveness of our approach.

研究の動機と目的

  • 視覚的シーンにおけるタスク完了のための行動シーケンス予測という、コンピュータビジョン分野であまり研究が進んでいない課題に取り組む。
  • 行動予測モデルの学習に、大規模なアノテート済みデータセットに依存するのを減らす。
  • タスク固有の知識(例:行動の階層構造や代替手段)を構造的表現を介してディープラーニングに統合する。
  • 追加のアノテーションが最小限または一切不要な状況でも、新しい関連タスクへの一般化を可能にする。
  • 日常生活のシナリオにおけるタスク指向行動予測のためのベンチマークデータセットを構築する。

提案手法

  • 2段階の学習フレームワーク:まず、タスクのAnd-Orグラフ(AOG)表現から有効な行動シーケンスを生成する補助的AOG-LSTMを訓練する。
  • AOGを用いて、順序付き依存関係(andノード)と代替手段(orノード)を含む、原子的行動としてタスクを階層的にモデル化する。
  • AOG-LSTMを用いてAOGから合成学習サンプル(行動シーケンス)を生成し、意味的に整合性のある学習データを大幅に拡張する。
  • 本物のアノテート済みデータとAOGによって生成された合成シーケンスの両方を用いて、主なAction-LSTMを訓練することで、一般化性能を向上させる。
  • エンコーダ・デコーダ型LSTMアーキテクチャを採用し、シーン画像とタスクをコンテキストベクトルにエンコードし、デコーダが段階的に行動シーケンスを生成する。
  • 長短時系列(LSTM)ユニットを活用して、行動シーケンス内の長距離依存関係をモデル化し、時間的推論性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1限られたアノテート済みデータでの学習において、ニューラルネットワークがタスク指向の行動予測に効果的に適用可能か。
  • RQ2行動の階層構造や代替手段といったタスク固有の知識を、どのように体系的に符号化し、シーケンス予測モデルに統合できるか。
  • RQ3構造化された知識表現(AOG)から生成された合成データが、モデル性能と一般化性能にどの程度向上効果をもたらすか。
  • RQ4追加のアノテーションが一切ない状況で、モデルが新しい関連タスクにどの程度一般化できるか。
  • RQ5AOGを介して構造化された知識を統合することで、行動認識およびシーケンス正解率に測定可能な向上が見られるか。

主な発見

  • 提案手法は、原子的行動の予測で平均96.40%の正解率を達成し、関連するオブジェクトの予測で91.50%の正解率を示し、ベースライン手法よりもそれぞれ2.9%および3.3%高い。
  • 行動シーケンス全体の予測において、平均92%のシーケンス正解率を達成し、ベースライン手法と比較して平均5.42%の向上を示した。
  • AOGによって生成された合成データを活用することで性能が顕著に向上:AOGが使用された場合、特にデータ量が少ない状況でシーケンス正解率が著しく向上した。
  • 未学習の関連タスク(例:「ディスペンサーからお湯を取ってお茶を淹れる」や「ボウルを使ってお湯を注ぐ」)において、AOGを用いたモデルは平均73.05%のシーケンス正解率を達成し、AOGなしのモデルと比較して約50%も優れた性能を示した。
  • AOG内の選択意思決定は意味的に制約されており、曖昧さが少ないため、少量のアノテート済みサンプルでもAOG-LSTMを効果的に訓練可能である。
  • LSTMベースのAction-LSTMは、行動シーケンス内の長期依存関係をより優れた能力でモデル化できるため、標準的なRNNよりも優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。