[论文解读] MART: Memory-Augmented Recurrent Transformer for Coherent Video Paragraph Captioning
该论文提出MART,一种用于连贯视频段落描述的增强记忆循环Transformer模型,通过引入一个记忆模块来总结视频片段和先前的句子历史,从而提升句子间的连贯性并减少重复。在ActivityNet Captions和YouCookII数据集上的实验表明,MART在连贯性和流畅性方面优于基于LSTM和原始Transformer的基线模型,同时保持了良好的视觉相关性。
Generating multi-sentence descriptions for videos is one of the most challenging captioning tasks due to its high requirements for not only visual relevance but also discourse-based coherence across the sentences in the paragraph. Towards this goal, we propose a new approach called Memory-Augmented Recurrent Transformer (MART), which uses a memory module to augment the transformer architecture. The memory module generates a highly summarized memory state from the video segments and the sentence history so as to help better prediction of the next sentence (w.r.t. coreference and repetition aspects), thus encouraging coherent paragraph generation. Extensive experiments, human evaluations, and qualitative analyses on two popular datasets ActivityNet Captions and YouCookII show that MART generates more coherent and less repetitive paragraph captions than baseline methods, while maintaining relevance to the input video events. All code is available open-source at: https://github.com/jayleicn/recurrent-transformer
研究动机与目标
- 为解决生成连贯、非重复的多句视频描述并保持视觉相关性的挑战。
- 克服标准Transformer中因孤立解码句子而缺乏对先前上下文感知所导致的上下文碎片化问题。
- 设计一种循环Transformer架构,以建模跨视频片段和生成句子的长距离依赖关系。
- 通过一个记忆模块总结历史信息并引导下一话语的生成,从而提升话语层面的连贯性。
- 在段落级视频描述任务中,实现优于基于LSTM和标准Transformer模型的性能。
提出的方法
- MART采用统一的编码器-解码器Transformer架构,并共享层以减少过拟合和内存使用。
- 引入一个记忆模块,用于存储和更新视频片段及先前生成句子的高度压缩状态。
- 在每个解码步骤中,通过与先前记忆状态的交叉注意力机制增强当前视频表示,实现上下文感知的生成。
- 通过结合当前输入和先前记忆来更新记忆状态,实现跨句子的循环机制。
- 采用端到端训练方式,使用交叉熵损失进行自回归下一个词预测。
- 将Transformer-XL的一种变体适配用于视频字幕任务,作为强大的基线模型进行对比。
实验结果
研究问题
- RQ1记忆增强的循环Transformer设计是否能提升视频段落描述中的话语层面连贯性?
- RQ2与标准Transformer相比,通过外部记忆模块引入总结性历史信息是否能有效降低句子层面的重复?
- RQ3在连贯性和相关性方面,MART与基于LSTM和标准Transformer模型相比表现如何?
- RQ4记忆模块是否可用于检索语义相似的视频片段,从而表明其捕捉到了有意义的表示?
- RQ5MART中的循环机制是否能有效建模跨多个视频片段和句子的长距离依赖关系?
主要发现
- 在ActivityNet Captions验证集上,MART在相关性和连贯性方面显著优于原始Transformer模型,C指标得分分别为22.87%和24.33%。
- 人工评估显示,MART在连贯性和相关性方面显著优于原始Transformer模型,共有54名工作者参与两两比较。
- 与Transformer-XL相比,MART在相关性表现上相当,但在连贯性方面显著更优,C指标的R@4得分为5.18%,表明重复率更低。
- 消融实验确认循环机制至关重要:移除该机制后,C得分从23.42降至22.78,表明其在连贯性中的关键作用。
- 记忆状态检索实验表明,记忆模块捕捉到了语义上有意义的表示,因为记忆空间中最近邻的样本通常与查询视频在语义上相关。
- 隐藏层为2层、记忆长度为1的模型在性能与计算成本之间达到最佳平衡,验证集上的C得分为23.42。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。