[论文解读] Multimodal Dialogue State Tracking By QA Approach with Data Augmentation
该论文提出了一种用于音频-视频场景感知对话(AVSD)的多模态开放域问答框架,采用带有多模态融合和注意力机制的序列到序列模型,并通过教师强制训练。该方法引入了一种新颖的数据增强技术,通过打乱对话历史中的问答对来提升泛化能力,在DSTC7-AVSD数据集上显著优于基线模型。
Recently, a more challenging state tracking task, Audio-Video Scene-Aware Dialogue (AVSD), is catching an increasing amount of attention among researchers. Different from purely text-based dialogue state tracking, the dialogue in AVSD contains a sequence of question-answer pairs about a video and the final answer to the given question requires additional understanding of the video. This paper interprets the AVSD task from an open-domain Question Answering (QA) point of view and proposes a multimodal open-domain QA system to deal with the problem. The proposed QA system uses common encoder-decoder framework with multimodal fusion and attention. Teacher forcing is applied to train a natural language generator. We also propose a new data augmentation approach specifically under QA assumption. Our experiments show that our model and techniques bring significant improvements over the baseline model on the DSTC7-AVSD dataset and demonstrate the potentials of our data augmentation techniques.
研究动机与目标
- 通过将多模态对话状态追踪问题重新构认为开放域问答问题,以应对AVSD中的挑战。
- 通过建模生成响应中的时间依赖性,提升多模态对话中的自然语言生成质量。
- 探究在多模态设置下,对话历史的内容是否比其顺序对问答更为重要。
- 开发一种数据增强策略,通过打乱对话历史中的问答对来提升训练数据的多样性。
- 评估教师强制和池化机制在提升响应生成质量方面的有效性。
提出的方法
- 采用编码器-解码器架构并结合多模态融合,将视觉、音频和文本编码联合表示学习。
- 使用双向GRU(BiGRUs)作为对话历史的序列编码器,并通过最大池化从时间步中提取主导特征。
- 在训练过程中应用教师强制,以强制自回归生成,即使用真实标签令牌作为下一步预测的输入。
- 引入一种数据增强技术,通过打乱对话历史中问答对的顺序来提升训练数据多样性,同时保留语义内容。
- 将课程采样作为基线对比,但发现其效果不如严格教师强制,因为训练过程中存在噪声预测。
- 采用交叉注意力机制,对齐问题表示与多模态上下文表示,以提升答案生成质量。
实验结果
研究问题
- RQ1将对话状态追踪建模为问答任务是否能提升多模态对话理解的性能?
- RQ2对话历史中问答对的顺序对准确答案生成是否至关重要?仅依赖内容是否足够?
- RQ3教师强制在提升多模态对话系统中生成响应的流畅性和准确性方面有多有效?
- RQ4通过打乱对话历史问答对进行数据增强,是否能在多模态问答中带来可测量的性能提升?
- RQ5池化策略(最大池化 vs. 平均池化)与RNN变体(BiGRU vs. BiLSTM)的哪种组合能获得最佳生成质量?
主要发现
- 与无教师强制的基线模型相比,教师强制在所有评估指标(BLEU、CIDEr等)上均提升了30%至300%。
- 最大池化优于平均池化,显著提高了BLEU和CIDEr得分,通过强调对话历史中的主导特征。
- 所提出的新型数据增强技术通过打乱问答对将数据集规模扩大两倍,进一步提升了模型性能。
- BiGRUs的性能与BiLSTMs相当,表明在此特定设置下,LSTM相比GRU并无显著优势。
- 课程采样未能提升性能,且因训练过程中的噪声预测导致训练不稳定。
- 在未使用教师强制的情况下,模型的CIDEr得分为0.224,而应用教师强制和数据增强后,该分数显著提高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。