[论文解读] Multi-modal Automated Speech Scoring using Attention Fusion
该论文提出了一种用于非英语母语者英语口语自动评分的多模态端到端神经网络模型,通过注意力融合声学(通过BDRCNN)和文本(通过BDLSTM)特征实现。该模型实现了最先进性能,相较于仅使用音频的基线模型,二次加权 kappa(QWK)相对提升 42.6%,相较于仅使用文本的模型提升 8.2%,表明对两种模态的注意力融合显著提升了评分准确性。
In this study, we propose a novel multi-modal end-to-end neural approach for automated assessment of non-native English speakers' spontaneous speech using attention fusion. The pipeline employs Bi-directional Recurrent Convolutional Neural Networks and Bi-directional Long Short-Term Memory Neural Networks to encode acoustic and lexical cues from spectrograms and transcriptions, respectively. Attention fusion is performed on these learned predictive features to learn complex interactions between different modalities before final scoring. We compare our model with strong baselines and find combined attention to both lexical and acoustic cues significantly improves the overall performance of the system. Further, we present a qualitative and quantitative analysis of our model.
研究动机与目标
- 开发一种用于非英语母语者英语口语自动评估的端到端多模态深度学习框架。
- 通过注意力机制融合声学与词汇特征,提升评分性能。
- 通过分析学习到的注意力权重在音频和文本模态上的分布,研究模型的可解释性。
- 在分布偏移情况下(如用白噪声或合成 TTS 输出替代真实语音)评估模型的鲁棒性。
- 探究在不同难度级别下,音频与文本模态对最终评分结果的相对重要性。
提出的方法
- 使用双向循环卷积神经网络(BDRCNN)对对数尺度梅尔频谱图进行编码,生成声学表征。
- 在自动语音识别(ASR)生成转录本的词嵌入上应用双向长短期记忆网络(BDLSTM),以学习文本内容表征。
- 在编码后的声学与文本特征上应用学习到的注意力融合机制,以建模复杂的跨模态交互关系,再进行最终评分。
- 使用从维基百科预训练的 300 维 GloVe 嵌入进行初始化,并在训练过程中进行微调以实现文本编码。
- 对注意力权重进行最小-最大归一化,以实现可视化,并对每个响应段落中模态的关注程度进行定性分析。
- 通过将真实语音输入替换为白噪声和 TTS 生成语音,开展消融实验,以评估模型的鲁棒性。
实验结果
研究问题
- RQ1与单模态模型相比,音频与文本模态之间的注意力融合如何提升自动语音评分性能?
- RQ2在不同响应质量水平下,声学与词汇特征对最终评分决策的相对贡献是什么?
- RQ3注意力权重在音频与文本模态之间的分布如何?是否与人类评分模式存在相关性?
- RQ4当在非 L2 语音(如母语 TTS 或白噪声)上测试时,模型性能相较于真实 L2 语音的下降程度如何?
- RQ5模型的注意力是否会显著聚焦于内容丰富的段落或不流畅段落?这种关注是否可与评分结果建立关联?
主要发现
- 所提出的多模态注意力融合(MMAF)模型在提示 1 上取得 52.9% 的 QWK,相较于仅使用 BDLSTM 的模型(47.3%)和仅使用 BDRCNN 的模型(30.2%)分别实现 8.2% 和 42.6% 的相对提升。
- MMAF 在所有提示上的平均 QWK 为 0.458,相较于仅使用音频的 BDRCNNAttn 模型相对提升 42.6%,相较于仅使用文本的 BDLSTMAttn 模型提升 8.2%。
- 模型对文本特征表现出强烈偏好,所有提示中注意力权重在文本与音频之间的比例约为 85:15。
- 对于低分响应,对音频的关注略有增加,这与更高的 ASR 词错误率和更低的语音可懂度相关。
- 将真实语音替换为白噪声后,QWK 平均下降 23.8%(未进行阈值优化);替换为 TTS 生成语音后,QWK 下降 27.2%,表明模型对 L2 语音特征敏感。
- 定性分析表明,模型在流利且内容丰富的段落(如“no smoking”)中更关注文本,而在不流畅表达(如“uh”和“um”)中则更关注音频。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。