[论文解读] Trear: Transformer-based RGB-D Egocentric Action Recognition
本文提出了一种基于Transformer的RGB-D自指动作识别框架Trear,通过帧间自注意力机制建模时序动态,并采用互注意融合模块联合表示RGB与深度模态。该方法在三个自指RGB-D数据集上实现了最先进性能,通过有效建模长距离依赖关系和跨模态交互,无需依赖光流或循环单元。
In this paper, we propose a extbf{Tr}ansformer-based RGB-D extbf{e}gocentric extbf{a}ction extbf{r}ecognition framework, called Trear. It consists of two modules, inter-frame attention encoder and mutual-attentional fusion block. Instead of using optical flow or recurrent units, we adopt self-attention mechanism to model the temporal structure of the data from different modalities. Input frames are cropped randomly to mitigate the effect of the data redundancy. Features from each modality are interacted through the proposed fusion block and combined through a simple yet effective fusion operation to produce a joint RGB-D representation. Empirical experiments on two large egocentric RGB-D datasets, THU-READ and FPHA, and one small dataset, WCVS, have shown that the proposed method outperforms the state-of-the-art results by a large margin.
研究动机与目标
- 通过结合RGB与深度模态,解决自指动作识别中有效多模态融合的不足。
- 在不使用光流或RNN的情况下,建模自指动作视频中的长距离时序依赖关系。
- 通过新颖的融合机制,利用跨模态交互提升细粒度动作识别性能。
- 通过随机裁剪和基于注意力的特征学习,缓解RGB-D自指数据中的模态差异性和冗余性。
提出的方法
- 该框架采用Transformer编码器与自注意力机制,分别在RGB和深度模态内建模帧间的时序关系。
- 对输入帧应用随机裁剪,以减少冗余并增强空间相关性学习。
- 互注意融合模块实现跨模态特征交互,使RGB与深度特征能够相互关注。
- 通过逐元素相加的方式融合互注意层的特征,生成联合的跨模态表示。
- 模型采用标准的Transformer编码器架构,结合多头自注意力与前馈网络进行序列建模。
- 该框架在自指RGB-D动作识别数据集上端到端训练,使用交叉熵损失函数。
实验结果
研究问题
- RQ1自注意力机制是否能在不使用光流或RNN的情况下,有效建模自指动作视频中的长距离时序依赖?
- RQ2与简单拼接或逐元素操作相比,互注意融合如何提升跨模态表示学习性能?
- RQ3随机裁剪在冗余的自指视频数据中,对特征学习的增强程度如何?
- RQ4所提出的框架是否在大规模RGB-D自指动作识别基准上优于现有最先进方法?
主要发现
- 在THU-READ(CS4)数据集上,该方法达到88.33%的top-1准确率,超越了先前最先进结果。
- 在FPHA数据集上,采用加法融合的模型达到96.34%的准确率,较之前方法提升超过1.5个百分点。
- 在THU-READ和WCVS数据集上,采用加法融合的互注意融合模块表现最佳,WCVS数据集上准确率达到71.50%。
- 与裁剪相同区域相比,随机裁剪在THU-READ上性能提升最高达3.75个百分点,在FPHA上提升达4.17个百分点。
- 注意力可视化结果表明,模型能正确识别关键动作阶段,如“饮用”和“拿起马克杯”,证明了其有效的时间建模能力。
- 消融实验表明,RGB模态的贡献大于深度模态,且不使用互注意的直接融合会降低性能,验证了跨模态交互的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。