[论文解读] Gaining Extra Supervision via Multi-task learning for Multi-Modal Video Question Answering
本文提出了一种用于多模态视频问答的多任务学习框架,通过联合训练视频问答网络与两个辅助任务(时间定位和模态对齐)来获得额外的监督信号。通过分层共享特征并采用受课程学习启发的多任务比例调度策略,该方法在TVQA基准上实现了67.05%的最先进性能,展示了协同学习信号带来的显著提升。
This paper proposes a method to gain extra supervision via multi-task learning for multi-modal video question answering. Multi-modal video question answering is an important task that aims at the joint understanding of vision and language. However, establishing large scale dataset for multi-modal video question answering is expensive and the existing benchmarks are relatively small to provide sufficient supervision. To overcome this challenge, this paper proposes a multi-task learning method which is composed of three main components: (1) multi-modal video question answering network that answers the question based on the both video and subtitle feature, (2) temporal retrieval network that predicts the time in the video clip where the question was generated from and (3) modality alignment network that solves metric learning problem to find correct association of video and subtitle modalities. By simultaneously solving related auxiliary tasks with hierarchically shared intermediate layers, the extra synergistic supervisions are provided. Motivated by curriculum learning, multi task ratio scheduling is proposed to learn easier task earlier to set inductive bias at the beginning of the training. The experiments on publicly available dataset TVQA shows state-of-the-art results, and ablation studies are conducted to prove the statistical validity.
研究动机与目标
- 为解决现有多模态视频问答基准中监督信号有限的问题,这些基准数据集规模太小,难以支持有效的深度学习。
- 通过利用提供额外监督信号的辅助任务来提升视频问答性能。
- 设计一种多任务学习框架,实现主问答任务与两个辅助任务(模态对齐和时间定位)之间的分层特征共享。
- 引入多任务比例调度策略,优先在训练初期处理较简单任务,以建立归纳偏差,受课程学习启发。
- 通过消融实验和TVQA数据集上的最先进结果,实证验证所提方法的有效性。
提出的方法
- 该方法采用一个多模态视频问答网络,融合视频和字幕特征以回答问题。
- 引入一个时间检索网络,预测与问题相对应的视频片段中的相关时刻,并与问答网络共享高层特征。
- 使用一个模态对齐网络来解决度量学习问题,确保视频与字幕特征的正确配对,并与问答网络共享底层特征。
- 模型采用分层参数共享机制:模态对齐共享早期层,而时间定位与问答网络共享更深层特征。
- 应用多任务比例调度策略来控制训练目标的比例,优先处理较简单的任务(模态对齐)以引导学习过程。
- 整个框架通过联合损失函数端到端训练,平衡主问答任务与两个辅助任务。
实验结果
研究问题
- RQ1像时间定位和模态对齐这样的辅助任务是否能提升多模态视频问答的性能?
- RQ2具有分层特征共享的多任务学习是否能提供协同监督信号,从而增强主问答任务?
- RQ3受课程学习启发的多任务比例调度是否能通过优先处理早期较简单任务来提升训练稳定性和性能?
- RQ4所提方法在TVQA基准上的性能与现有最先进模型相比如何?
- RQ5每个辅助任务(模态对齐与时间定位)对整体性能提升的相对贡献是什么?
主要发现
- 所提方法在使用视觉概念特征的情况下,于TVQA数据集上实现了67.05%的最先进测试准确率,比之前最佳模型高出1.59个百分点。
- 仅使用字幕的模型(S+Q)达到64.63%的准确率,超过使用ImageNet特征的TVQA S+V+Q基线模型(63.57%),证明了额外监督的有效性。
- 消融实验表明,时间定位和模态对齐均对性能有正向贡献,其中模态对齐带来的性能提升大于时间定位。
- 包含视觉概念特征和两个辅助任务的完整模型在验证集上达到66.22%的准确率,比基线问答模型高出0.85个百分点。
- 多任务比例调度通过早期建立归纳偏差,改善了训练动态,消融实验设置中均表现出一致的性能增益。
- 结果证实,通过精心设计的辅助任务进行多任务学习,即使在低监督设置下,也能显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。