[论文解读] Cross-Attention End-to-End ASR for Two-Party Conversations
该论文提出了一种利用多轮对话中双方面板的说话人特定对话上下文的交叉注意力端到端自动语音识别(ASR)模型,以提升长对话识别性能。通过整合关注自身及对方说话人历史的说话人特定交叉注意力机制,该模型在Switchboard上实现了16.4%的WER,在CallHome上实现了29.8%的WER,优于标准端到端模型。
We present an end-to-end speech recognition model that learns interaction between two speakers based on the turn-changing information. Unlike conventional speech recognition models, our model exploits two speakers' history of conversational-context information that spans across multiple turns within an end-to-end framework. Specifically, we propose a speaker-specific cross-attention mechanism that can look at the output of the other speaker side as well as the one of the current speaker for better at recognizing long conversations. We evaluated the models on the Switchboard conversational speech corpus and show that our model outperforms standard end-to-end speech recognition models.
研究动机与目标
- 通过建模跨说话人间的上下文依赖关系,提升长双人对话中的端到端语音识别性能。
- 解决传统ASR模型忽略说话人间上下文、仅依赖孤立话语的局限性。
- 开发一个统一的端到端框架,联合优化声学与对话上下文表征。
- 评估说话人特定交叉注意力机制在捕捉跨轮次长距离依赖关系方面的有效性。
- 在Switchboard和CallHome等标准对话语音基准上展示性能提升。
提出的方法
- 模型采用CNN-BLSTM编码器和基于注意力的解码器,并采用联合CTC/注意力训练。
- 引入基于多轮话语历史的BERT表征生成的说话人特定对话上下文嵌入。
- 交叉注意力机制使每个说话人的解码器能够关注自身及对方说话人的历史话语表征。
- 模型采用matchLSTM-based注意力机制,动态追踪跨轮次的说话人交互。
- 训练使用序列化对话小批量以保留小批量间的上下文信息,采用AdaDelta优化和梯度裁剪。
- 框架基于PyTorch和ESPnet实现,采用左右束搜索解码和长度归一化。
实验结果
研究问题
- RQ1建模说话人间对话上下文是否能提升长双人对话中端到端ASR的性能?
- RQ2通过比较当前说话人与对方说话人历史的说话人特定交叉注意力,对识别准确率有何影响?
- RQ3通过注意力机制整合多轮话语历史,是否能相比标准端到端模型降低WER?
- RQ4不同注意力机制(如matchLSTM与标准注意力)在捕捉对话流方面表现如何比较?
- RQ5统一的端到端模型是否能无需外部语言模型而联合优化声学与对话上下文?
主要发现
- 采用matchLSTM-based交叉注意力的所提模型在Switchboard测试集上实现了16.4%的WER,优于基线端到端模型。
- 在CallHome数据集上,模型实现了29.8%的WER,相比基线模型相对降低了1.1%。
- 在所有历史长度下,matchLSTM变体均略优于标准注意力机制,表明其在追踪对话流方面更具优势。
- 注意力可视化结果表明,模型聚焦于语义信息丰富的语句,而忽略如'oh'或'heck yeah'等短时非词汇填充词。
- 从基础对话模型进行预训练对模型稳定收敛至关重要,因为引入了额外的注意力参数。
- 该模型在Switchboard和CallHome上均实现了稳定的WER改进,表明其对多样化对话模式具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。