Skip to main content
QUICK REVIEW

[论文解读] Joint Hand Motion and Interaction Hotspots Prediction from Egocentric Videos

Shaowei Liu, Subarna Tripathi|arXiv (Cornell University)|Apr 4, 2022
Human Pose and Action Recognition被引用 4
一句话总结

本文提出了一种新颖的方法,通过联合预测未来动作物体的抓握轨迹和接触点(交互热点),来预测第一人称视频中的未来手-物体交互。该模型采用带有条件变分自编码器头的物体中心Transformer(OCT),利用自注意力机制推理手-物体交互,并通过概率采样建模不确定性,在Epic-Kitchens-55、Epic-Kitchens-100和EGTEA Gaze+数据集上实现了最先进性能,且实现了全自动、大规模的数据收集。

ABSTRACT

We propose to forecast future hand-object interactions given an egocentric video. Instead of predicting action labels or pixels, we directly predict the hand motion trajectory and the future contact points on the next active object (i.e., interaction hotspots). This relatively low-dimensional representation provides a concrete description of future interactions. To tackle this task, we first provide an automatic way to collect trajectory and hotspots labels on large-scale data. We then use this data to train an Object-Centric Transformer (OCT) model for prediction. Our model performs hand and object interaction reasoning via the self-attention mechanism in Transformers. OCT also provides a probabilistic framework to sample the future trajectory and hotspots to handle uncertainty in prediction. We perform experiments on the Epic-Kitchens-55, Epic-Kitchens-100, and EGTEA Gaze+ datasets, and show that OCT significantly outperforms state-of-the-art approaches by a large margin. Project page is available at https://stevenlsw.github.io/hoi-forecast .

研究动机与目标

  • 预测第一人称视频中未来手-物体交互,超越动作标签或像素级预测。
  • 利用概率框架对未来的手部运动和物体接触点的不确定性进行建模。
  • 开发一种无需人工标注的全自动、大规模数据收集流水线,用于手部轨迹和交互热点。
  • 通过将轨迹和热点预测作为中间表征,提升动作预测性能。
  • 通过提供准确且低维的未来交互预测,促进AR和机器人领域中的人机协作。

提出的方法

  • 一种全自动数据收集流水线利用现成的手部检测器和单应性投影,将未来手部和接触点位置回投影至最后一帧观测图像,生成对齐的、大规模的训练标签。
  • 物体中心Transformer(OCT)使用卷积神经网络对输入帧的视觉特征进行编码,将手部和物体特征作为以物体为中心的标记,将全局帧特征作为上下文标记。
  • Transformer编码器中的自注意力机制使模型能够在跨帧中联合推理手部、物体和环境上下文。
  • 解码器中的条件变分自编码器(C-VAE)头通过来自交叉注意力的条件潜在变量,预测手部轨迹和交互热点,从而建模不确定性。
  • 模型通过重建损失进行训练,将预测的轨迹和热点与自动收集数据中的真实标签进行比较。
  • 在动作预测任务上进行微调时,使用OCT编码器搭配一个MLP头,展示了所学表征的可迁移性。

实验结果

研究问题

  • RQ1与仅基于动作标签或像素预测相比,联合预测手部运动轨迹和交互热点是否能提升第一人称视频中未来交互的预测性能?
  • RQ2如何通过概率深度学习框架有效建模未来手-物体交互中的不确定性?
  • RQ3是否可以通过大规模自动数据收集替代昂贵的人工标注数据集,同时不降低性能?
  • RQ4轨迹和热点预测在多大程度上能提升下游任务(如动作预测)的性能?
  • RQ5建模手部运动与交互热点之间的条件依赖关系,如何提升预测准确性?

主要发现

  • OCT模型在Epic-Kitchens-55、Epic-Kitchens-100和EGTEA Gaze+数据集上的手部轨迹和交互热点预测任务中,显著优于最先进方法。
  • 在Epic-Kitchens-55上微调用于动作预测时,动词预测准确率提升4.3%,动作预测准确率提升4.4%;在Epic-Kitchens-100上,动词预测准确率提升2.9%,动作预测准确率提升2.6%。
  • 通过C-VAE的概率建模方法,能够生成多样化且具有不确定性的预测结果,如多个合理未来场景的定性可视化所示。
  • 全自动数据收集流水线成功生成了大规模、高质量的无人工标注标签,实现了可扩展的训练。
  • 轨迹估计有助于提升交互热点预测性能,且更多训练数据可带来更好的性能,表明模型具有强大的数据效率。
  • 在轨迹和热点预测任务上预训练的OCT模型,通过微调在动作预测任务上表现优于从零开始训练的模型,证明了所学表征的强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。