[论文解读] Predicting Human Interaction via Relative Attention Model
本文提出了一种三重耦合相对注意力网络,通过共享的循环结构和注意力机制,建模两个交互主体之间的相互影响,突出显示具有区分性的运动区域。通过整合全局交互上下文并利用注意力机制聚焦关键身体部位,该模型在仅观察50%视频的情况下,于BIT数据集上实现了超过90%的SOTA准确率,即使在遮挡和复杂背景条件下也表现出色。
Predicting human interaction is challenging as the on-going activity has to be inferred based on a partially observed video. Essentially, a good algorithm should effectively model the mutual influence between the two interacting subjects. Also, only a small region in the scene is discriminative for identifying the on-going interaction. In this work, we propose a relative attention model to explicitly address these difficulties. Built on a tri-coupled deep recurrent structure representing both interacting subjects and global interaction status, the proposed network collects spatio-temporal information from each subject, rectified with global interaction information, yielding effective interaction representation. Moreover, the proposed network also unifies an attention module to assign higher importance to the regions which are relevant to the on-going action. Extensive experiments have been conducted on two public datasets, and the results demonstrate that the proposed relative attention network successfully predicts informative regions between interacting subjects, which in turn yields superior human interaction prediction accuracy.
研究动机与目标
- 为解决从部分观测视频中预测人体交互的挑战,通过建模交互主体之间的相互影响来实现。
- 识别并聚焦于与交互预测最相关的时空区域,尤其是动态身体部位。
- 通过统一局部注意力与全局交互建模,克服整体特征、个体特征或基于部件特征方法的局限性。
- 通过学习的注意力机制强调与运动相关区域,提升对遮挡和背景杂波的鲁棒性。
提出的方法
- 采用三流深度循环网络,包含两个主体分支和一个包含两个主体的全局交互区域分支。
- 在每个时间步,聚合三个分支的隐藏状态以更新交互状态,实现相互影响的建模。
- 集成相对注意力模块,基于两个主体的当前动作和先前隐藏状态,动态选择信息丰富的区域。
- 注意力模块输出空间权重,仅聚焦于输入特征中的相关身体部位(如手臂、腿部),从而提升表征质量。
- 使用光流输入以增强对运动的敏感性,并在光流特征上应用注意力机制以检测关键运动模式。
- 最终通过分类头对三重耦合网络的注意力融合表示进行预测。
实验结果
研究问题
- RQ1在基于视频的动作预测框架中,如何有效建模两个交互主体之间的相互影响?
- RQ2与全帧特征相比,聚焦于具有区分性的局部运动区域(如肢体)对交互预测有何影响?
- RQ3与全局或个体特征学习相比,相对注意力机制是否能在部分观测和遮挡条件下提升性能?
- RQ4在多主体设置中,全局交互上下文的整合如何增强局部动作表征?
主要发现
- 所提方法在仅观察50%视频的情况下,于BIT数据集上实现超过90%的预测准确率,且在所有观测比例下均比之前SOTA方法高出10%以上。
- 三重耦合网络结合相对注意力机制在基线模型上取得显著性能提升,尤其在高观测比例下,证明了联合建模与注意力机制的有效性。
- 光流输入相比RGB帧显著提升性能,凸显了运动线索在交互预测中的重要性。
- 定性结果表明,注意力模块始终聚焦于与动作相关的关键身体部位(如伸展的手臂或腿部),与人类感知高度一致。
- 在严重遮挡和复杂背景条件下,模型仍保持鲁棒性,这从其在具有挑战性的BIT数据集上的优异表现中得到验证。
- 消融实验确认,相对注意力模块在三重耦合架构基础上提供了关键的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。