[论文解读] Multi-modal Ensemble Models for Predicting Video Memorability
本文提出了一种用于基于音频、视觉和文本特征预测视频记忆度的多模态集成模型。结果表明,基于VGGish的音频嵌入在短期记忆度预测中显著优于其他模态,表现出最高的泛化能力与最低的方差;同时,采用中位数聚合与加权平均的集成方法在小样本数据集上提升了模型鲁棒性。
Modeling media memorability has been a consistent challenge in the field of machine learning. The Predicting Media Memorability task in MediaEval2020 is the latest benchmark among similar challenges addressing this topic. Building upon techniques developed in previous iterations of the challenge, we developed ensemble methods with the use of extracted video, image, text, and audio features. Critically, in this work we introduce and demonstrate the efficacy and high generalizability of extracted audio embeddings as a feature for the task of predicting media memorability.
研究动机与目标
- 通过多模态特征提升视频记忆度(包括短期与长期)的预测性能。
- 探究音频嵌入(特别是VGGish)相较于视觉与文本特征的有效性。
- 通过稳健的集成策略应对小样本数据集中高方差与过拟合问题。
- 评估特征聚合方法(如中位数与均值)对模型性能的影响。
- 确定在记忆度预测中用于集成建模的最优模态组合。
提出的方法
- 从视频音频的每一秒中提取128维的VGGish音频嵌入,使用在AudioSet上预训练的模型。
- 从8个均匀分布的视频帧中提取2048维的图像特征,使用预训练ResNet-152的倒数第二层。
- 使用C3D提取视频级别的3D卷积特征,使用GloVe嵌入处理人工标注的字幕文本。
- 由于特征向量维度较高,分别对每种模态的特征训练独立模型(SVR、贝叶斯岭回归、GRU)。
- 对每个视频的多个基于字幕的预测结果应用中位数聚合,当无特征可用时默认使用平均值。
- 通过5折交叉验证对表现最佳的模型(VGGish、ResNet152、C3D、GloVe)的加权集成组合进行网格搜索。
实验结果
研究问题
- RQ1与视觉和文本特征相比,音频嵌入(特别是VGGish)在预测视频记忆度方面的有效性如何?
- RQ2基于中位数的多字幕预测聚合是否优于均值或最大值聚合?
- RQ3结合多种模态的集成模型是否能在小样本记忆度数据集上超越单模态模型?
- RQ4为何VGGish在短期记忆度预测中表现优于长期记忆度?这反映了特征泛化能力的何种含义?
- RQ5数据集规模与标注质量在多大程度上影响模型的泛化能力与测试性能?
主要发现
- VGGish音频嵌入在短期记忆度预测中实现了最高的平均斯皮尔曼等级相关系数(0.246),且方差最低(0.017),表明其具有极强的泛化能力。
- 在长期记忆度预测中,尽管方差较低,VGGish表现欠佳(平均SRCC = 0.059),表明其存在模态特异性局限性。
- 中位数聚合策略在多种模态上均优于均值、最大值和最小值聚合,尤其显著提升了模型的稳定性和性能。
- 最终的集成模型在短期记忆度预测中达到测试SRCC为0.136,在长期记忆度预测中为0.056,且验证集与测试集性能存在显著差异。
- 由于数据集规模较小以及训练集与开发集之间标注质量不一致,集成模型中观察到过拟合现象。
- 面部情绪特征与自动生成的字幕未能提升性能,因此未被纳入最终模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。