[论文解读] Large-scale Video Classification guided by Batch Normalized LSTM Translator
本文提出了一种新颖的视频分类框架,将多标签视频标记视为使用批量归一化LSTM(BNLSTM)翻译器的视频到句子翻译任务。通过将标签视为词语,并利用带有随机门控和批量归一化的引导LSTM,该方法提升了泛化能力,在大规模YouTube-8M数据集上实现了SOTA验证性能,使用MoE分类器达到79.1%的GAP。
Youtube-8M dataset enhances the development of large-scale video recognition technology as ImageNet dataset has encouraged image classification, recognition and detection of artificial intelligence fields. For this large video dataset, it is a challenging task to classify a huge amount of multi-labels. By change of perspective, we propose a novel method by regarding labels as words. In details, we describe online learning approaches to multi-label video classification that are guided by deep recurrent neural networks for video to sentence translator. We designed the translator based on LSTMs and found out that a stochastic gating before the input of each LSTM cell can help us to design the structural details. In addition, we adopted batch normalizations into our models to improve our LSTM models. Since our models are feature extractors, they can be used with other classifiers. Finally we report improved validation results of our models on large-scale Youtube-8M datasets and discussions for the further improvement.
研究动机与目标
- 解决大规模多标签视频分类中序列长度可变且标签分布未知的挑战。
- 探索使用深度循环网络将视频分类重新表述为视频到句子翻译问题的可行性。
- 通过在反馈回路中引入批量归一化和随机门控机制,提升LSTM的泛化能力。
- 评估所提模型作为特征提取器在多种下游分类器(包括MoE)中的有效性。
提出的方法
- 该方法将每个标签向量视为一串词语,将多标签视频分类转化为视频到句子的翻译任务。
- 在基础LSTM模型中引入引导反馈机制,以概率β注入真实标签,从而实现更好的隐藏状态追踪。
- 在每个LSTM单元输入前引入随机门控,以改善训练动态并缓解反馈瓶颈。
- 对LSTM层应用批量归一化(BNLSTM),以减少内部协变量偏移并加速收敛。
- 模型使用YouTube-8M数据集中预提取的Inception CNN特征,以平均池化作为特征聚合的基线方法。
- 最终的特征表示与逻辑分类器或MoE模型结合用于分类,支持迁移学习和模型可扩展性。
实验结果
研究问题
- RQ1能否通过循环神经网络将多标签视频分类有效重构为视频到句子的翻译任务?
- RQ2在不同β值下,带有引导反馈的LSTM在视频分类中的性能与泛化能力如何变化?
- RQ3批量归一化对大规模视频识别中基于LSTM的特征提取器有何影响?
- RQ4将随机门控与批量归一化结合是否能带来一致的性能提升,还是存在稳定性方面的权衡?
- RQ5所提出的BNLSTM模型能否作为鲁棒的特征提取器,适用于MoE等多样化下游分类器?
主要发现
- 在β = 0.0(不注入真实标签)时,引导LSTM达到最高的76.3% GAP,优于β > 0.0的设置,表明充分利用反馈回路可提升性能。
- 使用逻辑分类器的BNLSTM模型达到78.3% GAP,显著优于基础模型(75.9%)和仅使用BN层的模型(77.9%)。
- BNLSTM与MoE分类器结合实现了最高的79.1% GAP验证性能,证明了该模型与先进分类器的兼容性与可扩展性。
- 同时使用BN层和BNLSTM并未带来优于BNLSTM单独使用的效果,表明多个具有不同总体统计特性的BN层可能引发潜在不稳定性。
- 在引导LSTM中采用每个词投影的独立二元交叉熵损失,消除了softmax瓶颈,相比基础模型加速了学习过程。
- 实验表明,使用平均池化可能导致帧序信息丢失,提示用LSTM编码器或注意力机制替代平均池化可能进一步提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。