[论文解读] TransAction: ICL-SJTU Submission to EPIC-Kitchens Action Anticipation Challenge 2021
本文提出 TransAction,一种基于分层 Transformer 的自指动作预测模型,通过时序自注意力、跨模态注意力以及动词与名词分支之间的共生注意力,融合多模态特征(RGB、光流、目标检测)。该模型在 EPIC-Kitchens 测试集上实现了 13.39% 的平均 Top-5 召回率,并在所有子集的动词预测中排名第一,通过使用均衡损失在长尾动作类别上取得改进。
In this report, the technical details of our submission to the EPIC-Kitchens Action Anticipation Challenge 2021 are given. We developed a hierarchical attention model for action anticipation, which leverages Transformer-based attention mechanism to aggregate features across temporal dimension, modalities, symbiotic branches respectively. In terms of Mean Top-5 Recall of action, our submission with team name ICL-SJTU achieved 13.39% for overall testing set, 10.05% for unseen subsets and 11.88% for tailed subsets. Additionally, it is noteworthy that our submission ranked 1st in terms of verb class in all three (sub)sets.
研究动机与目标
- 为解决自指动作预测中的挑战,即未来动作高度不确定且具有多模态特性,且过去观测具有异步因果影响。
- 改善自指视频数据集中长尾动作分布下的泛化能力,其中罕见动作出现频率较低。
- 通过在统一注意力框架中实现动词与名词预测头之间的共生交互,建模二者之间的相互依赖关系。
- 通过利用 Transformer 在帧间捕捉长距离依赖的能力,超越 RNN 实现更优的时间建模。
- 通过采用稳健、模块化且可扩展的架构,在 EPIC-Kitchens 动作预测挑战 2021 中实现最先进性能。
提出的方法
- 该模型采用分层 Transformer 架构,包含三个核心模块:时序自注意力(TSA),用于建模帧间长距离时间依赖。
- 跨模态注意力(CMA)通过共享注意力机制,融合来自 RGB、光流和目标检测模态的特征。
- 共生注意力(SA)在动词与名词预测头之间实现双向特征交互,以利用其上下文依赖关系。
- 该框架被实现为两个模块的级联结构,每个模块依次应用 TSA、CMA 和 SA,以逐步优化特征表示。
- 通过应用均衡损失,减少在预测稀有类别时对频繁类别的梯度更新,以缓解类别不平衡问题。
- 采用三个 TransAction 模型与一个 RULSTM-Fusion 基线模型的集成,以提升测试集上的泛化能力与性能。
实验结果
研究问题
- RQ1分层 Transformer 架构能否有效建模自指动作预测中的长距离时间依赖?
- RQ2跨模态注意力在 RGB、光流与目标模态之间如何提升特征融合效果,以支持动作预测?
- RQ3动词与名词分支之间的共生注意力在多大程度上提升了预测准确率,特别是在罕见动作上?
- RQ4均衡损失是否能显著改善模型在自指视频数据集中长尾动作分布上的泛化能力?
- RQ5将 TransAction 与强基线模型(RULSTM-Fusion)进行集成,是否能在 EPIC-Kitchens 测试集上持续带来性能提升?
主要发现
- 所提出的 TransAction 模型在 EPIC-Kitchens 动作预测挑战 2021 的整体测试集上实现了 13.39% 的平均 Top-5 召回率。
- 在未见子集上,模型实现了 10.05% 的平均 Top-5 召回率,表明其对未见过的动作具有强大的泛化能力。
- 在尾部子集上,模型实现了 11.88% 的平均 Top-5 召回率,表明其在罕见及长尾动作类别上性能有所提升。
- 该模型在所有三个测试子集的动词预测中排名第一,在整体测试集上实现了 36.15% 的平均 Top-5 召回率。
- 消融实验表明,移除共生注意力模块导致性能下降最大,表明其在联合动词-名词预测中起着关键作用。
- TransAction 与 RULSTM-Fusion 模型的集成实现了最佳整体性能,尤其显著提升了尾部动作子集的结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。