[论文解读] End-to-End ASR for Code-switched Hindi-English Speech
该论文提出结合CTC与注意力损失的多任务学习(MTL)方法,并通过过采样缓解类别不平衡问题,以提升低资源混合语种印地语-英语语音(训练数据仅46.65小时)的端到端自动语音识别性能。最佳模型实现47.2%的WER,相较未平衡数据提升5个百分点绝对值,最优MTL权重λ为0.7–0.9。
End-to-end (E2E) models have been explored for large speech corpora and have been found to match or outperform traditional pipeline-based systems in some languages. However, most prior work on end-to-end models use speech corpora exceeding hundreds or thousands of hours. In this study, we explore end-to-end models for code-switched Hindi-English language with less than 50 hours of data. We utilize two specific measures to improve network performance in the low-resource setting, namely multi-task learning (MTL) and balancing the corpus to deal with the inherent class imbalance problem i.e. the skewed frequency distribution over graphemes. We compare the results of the proposed approaches with traditional, cascaded ASR systems. While the lack of data adversely affects the performance of end-to-end models, we see promising improvements with MTL and balancing the corpus.
研究动机与目标
- 解决在训练数据不足50小时的低资源环境下,对混合语种印地语-英语语音进行端到端ASR模型训练的挑战。
- 通过缓解音位频率分布中的类别不平衡问题,克服低资源环境下性能下降的问题。
- 评估结合CTC与基于注意力的损失函数的多任务学习在混合语种ASR中的有效性。
- 提升模型鲁棒性,减少混合语种语音识别中常见的替换错误。
提出的方法
- 通过加权组合参数λ联合优化CTC与基于注意力的损失函数,实现多任务学习(MTL)。
- 采用损失的凸组合形式:L_total = λ × L_CTC + (1−λ) × L_attention,其中λ ∈ [0,1]以平衡损失贡献。
- 使用Adadelta优化器训练模型,基于验证损失进行早停,训练在15k–21k个梯度更新步数内收敛。
- 通过过采样平衡训练数据中的字符频率,提升少数字符的表示。
- 将训练集通过过采样扩充至120万句,原始数据为4.1万句,针对频率低于均值的字符进行处理。
- 在推理阶段应用字符级语言模型重打分,以提升假设输出的质量。
实验结果
研究问题
- RQ1在低资源混合语种印地语-英语语音中,结合CTC与注意力损失的多任务学习能否提升端到端ASR性能?
- RQ2在混合语种ASR的MTL中,损失加权参数λ的最优值是多少,可实现稳定且最低的错误率?
- RQ3在低资源设置下,音位频率的类别不平衡如何影响端到端ASR性能?
- RQ4对少数音位进行过采样在多大程度上能改善混合语种ASR的WER与模型鲁棒性?
主要发现
- 当λ ∈ [0.7, 0.9]时,多任务学习实现最稳定且最低的WER;而λ ≈ 0.5时出现性能急剧下降,WER超过100%。
- λ = 0.7的模型表现最佳,字符混淆矩阵显示印地语与英语音位的错误均最小。
- 通过过采样校正类别不平衡后,最小字符频率从3提升至约20,631,数据集规模扩大至120万句。
- 平衡后的数据集使测试WER降低5个百分点绝对值,达到47.2%,相较未平衡基线模型有显著提升。
- 采用平衡数据的MTL模型收敛更快且达到更低的损失,尽管每轮训练时间更长。
- 替换错误最常发生在相似音位之间(如带变音符号的鼻辅音),表明需改进语言建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。