[论文解读] Contextualized Attention-based Knowledge Transfer for Spoken Conversational Question Answering
本文提出CADNet,一种基于上下文注意力的知识蒸馏框架,通过利用交叉注意力和自注意力机制对齐人工转录文本与ASR转录文本,同时采用教师-学生范式迁移ASR鲁棒知识,从而提升语音对话问答(SCQA)性能。该方法在Spoken-CoQA数据集上实现最先进性能,将ASR错误的负面影响降至最低,在高度嘈杂转录文本上的F1分数最高达59.6%。
Spoken conversational question answering (SCQA) requires machines to model complex dialogue flow given the speech utterances and text corpora. Different from traditional text question answering (QA) tasks, SCQA involves audio signal processing, passage comprehension, and contextual understanding. However, ASR systems introduce unexpected noisy signals to the transcriptions, which result in performance degradation on SCQA. To overcome the problem, we propose CADNet, a novel contextualized attention-based distillation approach, which applies both cross-attention and self-attention to obtain ASR-robust contextualized embedding representations of the passage and dialogue history for performance improvements. We also introduce the spoken conventional knowledge distillation framework to distill the ASR-robust knowledge from the estimated probabilities of the teacher model to the student. We conduct extensive experiments on the Spoken-CoQA dataset and demonstrate that our approach achieves remarkable performance in this task.
研究动机与目标
- 解决由于转录文本中自动语音识别(ASR)错误导致的语音对话问答(SCQA)性能下降问题。
- 开发一种方法,提升模型对噪声ASR转录文本的鲁棒性,同时在多轮对话中保持上下文理解能力。
- 通过注意力机制同时利用人工(参考)文本与ASR转录文本,以改善表征学习。
- 设计一种知识蒸馏框架,将教师模型从干净参考文本中学习到的鲁棒知识迁移至在噪声ASR数据上训练的学生模型。
- 在不同ASR词错误率(WER)水平下评估所提方法的有效性。
提出的方法
- CADNet采用交叉注意力与自注意力机制,对齐人工参考文本与ASR转录文本在上下文表示上的对齐。
- 模型采用教师-学生蒸馏框架,其中在干净参考文本上训练的教师模型为在噪声ASR转录文本上训练的学生模型提供软标签监督。
- 通过基于Transformer的编码器学习上下文表征,采用BPE分词时通过平均子词标记的BERT嵌入实现特征融合。
- 知识蒸馏采用基于温度的软标签损失,超参数α = 0.9以平衡交叉熵损失与蒸馏目标。
- 该框架在Spoken-CoQA数据集上进行评估,模型在基于文本和ASR转录的训练集上均进行微调。
- 评估采用精确匹配(EM)和F1分数作为指标,使用帧级别F1评估不同WER水平下的性能。
实验结果
研究问题
- RQ1在面对噪声ASR转录文本时,上下文注意力机制是否能提升SCQA中的表征学习?
- RQ2从在干净文本上训练的教师模型蒸馏知识,是否能提升学生模型在噪声ASR数据上的鲁棒性?
- RQ3所提方法在ASR转录文本中不同词错误率(WER)水平下的表现如何?
- RQ4结合交叉注意力与自注意力在多轮对话理解中的SCQA任务中,是否能显著提升性能?
- RQ5所提方法是否在Spoken-CoQA基准上优于强基线模型如BERT、ALBERT、FlowQA和SDNet?
主要发现
- 在FlowQA上应用上下文注意力与知识蒸馏(CA+KD)的CADNet在人工转录文本上取得54.7%的F1分数,在ASR转录文本上取得39.9%的F1分数,分别优于基线3.1和5.2个百分点。
- SDNet结合CA+KD在人工转录文本上达到56.5%的F1分数,在ASR转录文本上达到57.7%的F1分数,分别优于基线4.0和4.6个百分点。
- BERT-base结合CA+KD在人工转录文本上取得58.8%的F1分数,在ASR转录文本上达到59.6%的F1分数,分别优于基线3.0和3.6个百分点。
- ALBERT-base结合CA+KD在人工转录文本上取得57.7%的F1分数,在ASR转录文本上达到58.7%的F1分数,分别优于基线3.6和3.5个百分点。
- 该方法在所有评估模型中均表现出一致的性能提升,表明其对多种模型架构具有良好的泛化能力。
- 在WER水平逐渐增加的情况下性能保持稳定,即使在高WER下也观察到显著提升,证实了对ASR噪声的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。