[论文解读] Multi-modal Feature Fusion with Feature Attention for VATEX Captioning Challenge 2020
该论文提出了一种多模态视频字幕模型,通过可学习的特征注意力机制融合运动、外观、语义和音频特征。通过结合自顶向下和X-LAN解码器,并采用多阶段训练策略,该方法在英语私有测试集上取得76.0的CIDEr得分,在中文私有测试集上取得50.0的CIDEr得分,在VATEX 2020字幕挑战赛的英语和中文赛道中均排名第二。
This report describes our model for VATEX Captioning Challenge 2020. First, to gather information from multiple domains, we extract motion, appearance, semantic and audio features. Then we design a feature attention module to attend on different feature when decoding. We apply two types of decoders, top-down and X-LAN and ensemble these models to get the final result. The proposed method outperforms official baseline with a significant gap. We achieve 76.0 CIDEr and 50.0 CIDEr on English and Chinese private test set. We rank 2nd on both English and Chinese private test leaderboard.
研究动机与目标
- 通过融合运动、外观、语义和音频的多模态特征,提升视频字幕生成性能。
- 通过多阶段训练策略,缓解自回归解码中的暴露偏差问题。
- 通过在解码过程中学习对多样化模态的动态注意力权重,增强特征融合效果。
- 在VATEX 2020视频字幕挑战赛的英语和中文赛道中均实现最先进性能。
提出的方法
- 使用I3D和SlowFast 3D CNN提取运动特征,使用PNASNet提取外观特征,使用Faster R-CNN提取区域特征,并通过ECO网络生成2D-3D融合特征。
- 通过在视觉特征上应用多层感知机生成语义特征,将预测的属性和主题概率拼接并复制到所有帧上。
- 通过VGGish模型从16 kHz音频的梅尔频谱图块中提取音频特征。
- 实现一个特征注意力模块,基于解码器隐藏状态,利用门控机制动态计算多模态特征的权重。
- 采用两种解码器:基于GRU的自顶向下模型(带自底向上注意力)和使用X-Linear注意力机制进行双线性特征选择的X-LAN模型。
- 应用三阶段训练流程:交叉熵损失、词级最优策略(oracle)和带有学习率衰减的自回归策略梯度训练(self-critical training)。
实验结果
研究问题
- RQ1联合建模运动、外观、语义和音频特征是否能提升视频字幕生成性能?
- RQ2可学习的特征注意力机制在解码过程中动态加权多模态输入方面是否有效?
- RQ3结合自顶向下和X-LAN解码器并采用集成学习方法,是否能比单一模型获得更好的泛化性能?
- RQ4多阶段训练策略在多大程度上缓解了暴露偏差问题并提升了CIDEr得分?
- RQ5所提方法是否具备跨语言泛化能力,能否在英语和中文视频字幕基准上均实现优异性能?
主要发现
- 集成模型在英语私有测试集上取得76.0的CIDEr得分,在VATEX 2020英语赛道中排名第二。
- 该模型在中文私有测试集上取得50.0的CIDEr得分,在中文赛道中排名第二。
- 在英语和中文任务的验证集上,X-LAN模型均优于自顶向下模型。
- 多阶段训练策略(包括词级最优策略和自回归策略梯度训练)显著提升了CIDEr得分。
- 特征注意力模块有效融合了多模态特征,实现了更优的上下文感知字幕生成。
- 该模型在跨语言场景下展现出强大的零样本泛化能力,在英语和中文测试集上均取得了高性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。