QUICK REVIEW
[论文解读] FBK-HUPBA Submission to the EPIC-Kitchens 2019 Action Recognition Challenge
Swathikiran Sudhakaran, Sérgio Escalera|arXiv (Cornell University)|Jun 21, 2019
Human Pose and Action Recognition参考文献 4被引用 6
一句话总结
本论文针对EPIC-Kitchens 2019数据集提出了一种CNN-LSTA与HF-TSN变体的集成模型,通过晚期和早期时间特征聚合、跨模态融合以及结构化预测来建模动词-名词依赖关系。该集成模型在S1上达到35.54%的top-1准确率,在S2上达到20.25%,证明了互补建模方法与模型集成在第一人称动作识别中的有效性。
ABSTRACT
In this report we describe the technical details of our submission to the EPIC-Kitchens 2019 action recognition challenge. To participate in the challenge we have developed a number of CNN-LSTA [3] and HF-TSN [2] variants, and submitted predictions from an ensemble compiled out of these two model families. Our submission, visible on the public leaderboard with team name FBK-HUPBA, achieved a top-1 action recognition accuracy of 35.54% on S1 setting, and 20.25% on S2 setting.
研究动机与目标
- 为解决在小物体操作场景下第一人称视频中的细粒度动作识别挑战。
- 通过结合互补的时间特征聚合策略(晚期LSTA与早期HF-TSN融合)提升识别准确率。
- 通过引入动作级别偏置项的结构化预测,建模动词与名词类别之间的相互依赖关系。
- 通过外观与运动流的跨模态融合提升性能。
- 通过融合多种架构与训练策略的模型,实现最先进性能。
提出的方法
- 提出基于ResNet-34、ResNet-50和InceptionV3主干网络的CNN-LSTA变体,并在ImageNet和Kinetics上进行微调。
- 通过GRU机制聚合输出状态,增强LSTA的性能,并采用双流架构结合光流实现跨模态融合。
- 开发了基于残差网络-50和BNInception主干网络的HF-TSN变体,通过卷积时间门控实现分层特征聚合。
- 通过两层全连接层将动作得分作为实例特定偏置项引入动词和名词分类器,实现结构化预测。
- 通过多个模型预测得分的集成平均,提升泛化能力与性能。
- 在两类模型中均应用时间池化与晚期融合,将帧级特征聚合为动作级预测。
实验结果
研究问题
- RQ1在第一人称动作识别中,晚期与早期时间特征聚合策略是否能够相互补充?
- RQ2外观与运动流的跨模态融合是否能提升EPIC-Kitchens数据集上的识别准确率?
- RQ3通过动作级别偏置项建模依赖关系的结构化预测,是否能减少不合理的动词-名词对预测?
- RQ4在不同架构与训练策略下进行模型集成,能在多大程度上提升性能?
- RQ5不同主干网络(ResNet、Inception)在细粒度第一人称动作识别中的表现有何差异?
主要发现
- 所有模型的集成在S1设置下达到35.54%的top-1准确率,优于单个模型。
- 采用ResNet-34的LSTA-GRU变体达到32.14%的top-1准确率,通过跨模态融合提升至32.60%。
- HF-TSN-ResNet50模型在S2上达到17.38%的top-1准确率,通过完整集成提升至20.25%。
- 跨模态融合为LSTA模型带来2%的准确率增益,而与LSTA-2S及HF-TSN-BNInception的集成带来1%的性能提升。
- 结构化预测方法通过动作级别偏置项建模依赖关系,有效减少了不合理动词-名词对的预测。
- 基于架构与训练多样性构建的模型集成被证明极为有效,最终集成在S2上达到20.25%的top-1准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。