Skip to main content
QUICK REVIEW

[论文解读] Knowledge-Guided Recurrent Neural Network Learning for Task-Oriented Action Prediction

Liang Lin, Lili Huang|arXiv (Cornell University)|Jul 15, 2017
Human Pose and Action Recognition参考文献 14被引用 4
一句话总结

该论文提出了一种知识引导的循环LSTM网络用于任务导向型动作预测,利用时间And-Or图(AOG)生成合成训练数据,减少对标注样本的依赖。该方法在平均序列准确率上达到92%,在未见相关任务上的准确率为73.05%,展现出强大的泛化能力和数据效率。

ABSTRACT

This paper aims at task-oriented action prediction, i.e., predicting a sequence of actions towards accomplishing a specific task under a certain scene, which is a new problem in computer vision research. The main challenges lie in how to model task-specific knowledge and integrate it in the learning procedure. In this work, we propose to train a recurrent long-short term memory (LSTM) network for handling this problem, i.e., taking a scene image (including pre-located objects) and the specified task as input and recurrently predicting action sequences. However, training such a network usually requires large amounts of annotated samples for covering the semantic space (e.g., diverse action decomposition and ordering). To alleviate this issue, we introduce a temporal And-Or graph (AOG) for task description, which hierarchically represents a task into atomic actions. With this AOG representation, we can produce many valid samples (i.e., action sequences according with common sense) by training another auxiliary LSTM network with a small set of annotated samples. And these generated samples (i.e., task-oriented action sequences) effectively facilitate training the model for task-oriented action prediction. In the experiments, we create a new dataset containing diverse daily tasks and extensively evaluate the effectiveness of our approach.

研究动机与目标

  • 为解决在视觉场景中预测动作序列以完成任务的问题,该问题在计算机视觉领域尚未得到充分探索。
  • 减少对大规模标注数据集的依赖,以训练动作预测模型。
  • 通过结构化表示将特定任务的知识(例如动作层次结构和替代选项)整合到深度学习中。
  • 在极少或无需额外标注的情况下,实现对新相关任务的泛化能力。
  • 为日常生活中任务导向型动作预测创建一个基准数据集。

提出的方法

  • 采用两阶段训练框架:首先训练一个辅助AOG-LSTM,从任务的And-Or图(AOG)表示中生成有效动作序列。
  • 利用AOG对任务进行分层建模,将任务表示为原子动作,其中与节点(and-nodes)表示顺序依赖关系,或节点(or-nodes)表示替代选项。
  • 使用AOG-LSTM从AOG中生成合成训练样本(动作序列),显著扩展训练数据量,同时保持语义一致性。
  • 使用真实标注数据和AOG生成的合成序列联合训练主动作-LSTM,以提升泛化能力。
  • 采用编码器-解码器LSTM架构,将场景图像和任务编码为上下文向量,解码器逐步生成动作序列。
  • 利用长短期记忆(LSTM)单元建模动作序列中的长程依赖关系,提升时间推理能力。

实验结果

研究问题

  • RQ1在标注数据有限的情况下,神经网络能否被有效训练用于任务导向型动作预测?
  • RQ2如何系统性地编码并整合特定任务知识(如动作层次结构和替代选项)到序列预测模型中?
  • RQ3从结构化知识表示(AOG)生成的合成数据在多大程度上能提升模型性能和泛化能力?
  • RQ4该模型在无需额外标注样本的情况下,对新相关任务的泛化能力如何?
  • RQ5通过AOG引入结构化知识是否能显著提升动作识别和序列准确率?

主要发现

  • 所提出的模型在预测原子动作方面达到96.40%的平均准确率,在预测相关物体方面达到91.50%的准确率,分别优于基线方法2.9%和3.3%。
  • 在预测完整动作序列方面,模型实现了92%的平均序列准确率,相较于基线方法平均提升5.42%。
  • 使用AOG生成的合成数据能显著提升性能:当引入AOG时,序列准确率明显提高,尤其在低数据环境下效果更显著。
  • 在未见相关任务上(例如“使用饮水机中的水冲茶”和“用碗倒水”),使用AOG的模型实现了73.05%的平均序列准确率,较无AOG的模型高出近50%。
  • AOG-LSTM可在少量标注样本上有效训练,因为AOG中的选择决策具有语义约束,歧义性较低。
  • 基于LSTM的Action-LSTM优于标准RNN,因其在建模动作序列长程依赖关系方面具有更强的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。