[论文解读] Human Action Forecasting by Learning Task Grammars
本文提出了一种深度学习框架,通过使用堆叠LSTM进行多粒度进度估计,学习时间任务语法,以预测顺序任务中的人类动作。通过引入一种新颖的累积欧氏损失(CPLoss)进行进度估计,该方法在基准数据集上的动作预测准确率相比基线双流模型提高了9%以上,展示了在复杂、长时程机器人辅助任务中卓越的性能。
For effective human-robot interaction, it is important that a robotic assistant can forecast the next action a human will consider in a given task. Unfortunately, real-world tasks are often very long, complex, and repetitive; as a result forecasting is not trivial. In this paper, we propose a novel deep recurrent architecture that takes as input features from a two-stream Residual action recognition framework, and learns to estimate the progress of human activities from video sequences -- this surrogate progress estimation task implicitly learns a temporal task grammar with respect to which activities can be localized and forecasted. To learn the task grammar, we propose a stacked LSTM based multi-granularity progress estimation framework that uses a novel cumulative Euclidean loss as objective. To demonstrate the effectiveness of our proposed architecture, we showcase experiments on two challenging robotic assistive tasks, namely (i) assembling an Ikea table from its constituents, and (ii) changing the tires of a car. Our results demonstrate that learning task grammars offers highly discriminative cues improving the forecasting accuracy by more than 9% over the baseline two-stream forecasting model, while also outperforming other competitive schemes.
研究动机与目标
- 解决人类-机器人交互中常见于长时序、复杂且多变的顺序任务中的人类动作预测挑战。
- 克服马尔可夫模型因丢失全局上下文而难以处理重复或非顺序动作的局限性。
- 通过视频序列中进度估计隐式学习全局时间任务语法,提升长序列中的预测准确率。
- 开发一种多粒度循环架构,捕捉细粒度与粗粒度的时间进度,以实现更精确的定位与预测。
- 提出一种新颖的累积欧氏损失(CPLoss),根据与真实值的接近程度惩罚进度估计误差,提升训练稳定性和性能。
提出的方法
- 利用双流残差CNN提取视频片段中的局部动作表征。
- 采用堆叠LSTM网络估计任务内活动的进度,使用离散化的时间单元以增强鲁棒性。
- 引入一种多粒度LSTM框架,在多个时间尺度(如5、10、20个片段)上估计进度,以捕捉短时与长时动作。
- 提出一种新颖的累积欧氏损失(CPLoss),计算预测与真实进度的累积和,通过时间反向传播最小化欧氏距离。
- 将双流CNN的局部动作预测与多粒度LSTM的全局进度估计相结合,以预测下一个动作。
- 通过从更长视频片段中随机采样子序列进行数据增强,端到端训练整个模型,使用时间反向传播。
实验结果
研究问题
- RQ1通过在任务中隐式学习时间进度,能否捕捉到全局任务语法,从而提升长而复杂序列中的动作预测?
- RQ2与单尺度估计相比,多粒度进度估计是否能提升长时程人类活动中的预测性能?
- RQ3与标准交叉熵损失相比,所提出的累积欧氏损失(CPLoss)在训练进度估计网络用于动作预测时表现如何?
- RQ4全局进度估计的整合在现实世界机器人辅助任务中,对局部动作预测准确率的提升程度如何?
- RQ5所提方法的性能增益是否在不同动作复杂度与视觉变异性的数据集上存在差异?
主要发现
- 在IFA-Bench数据集上,使用CPLoss时,该方法将动作预测准确率提高了9.6%;在IFA-Ground数据集上提高了9.4%,显著优于基线双流模型。
- 在IFA-Bench数据集上,结合局部与全局建模时,使用CPLoss可实现5.9%的提升,使用交叉熵损失可实现9.6%的提升。
- 基于LSTM的进度估计模型在所有序列长度(5、10、20帧)上均优于RNN、GRU和全连接(FC)层,尤其在长序列中表现最佳。
- 增加训练子序列长度可提升预测准确率,减小进度窗口大小(如从10个片段减少到20个片段)可进一步提升性能,但会增加细粒度识别的难度。
- 多粒度框架(+5+10+20)始终优于单粒度与双粒度设置,证明了分层时间建模的优势。
- 在Changing Tire数据集上,使用CPLoss可实现2.4%的性能提升,表明在较不复杂的动作序列中,增益虽稳定但更为温和。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。