[论文解读] On the Inductive Bias of Word-Character-Level Multi-Task Learning for Speech Recognition
本文提出一种多任务学习(MTL)框架,通过连接时序分类(CTC)联合训练词级别和字符级别的自动语音识别(ASR)。通过结合词级别监督与字符级别正则化,模型将词错误率(WER)降低至23%,显著优于单一任务基线模型,且消除了未知词标记预测。关键贡献在于通过实证方法刻画了MTL的归纳偏差,表现为词频与词长偏好之间的插值。
End-to-end automatic speech recognition (ASR) commonly transcribes audio signals into sequences of characters while its performance is evaluated by measuring the word-error rate (WER). This suggests that predicting sequences of words directly may be helpful instead. However, training with word-level supervision can be more difficult due to the sparsity of examples per label class. In this paper we analyze an end-to-end ASR model that combines a word-and-character representation in a multi-task learning (MTL) framework. We show that it improves on the WER and study how the word-level model can benefit from character-level supervision by analyzing the learned inductive preference bias of each model component empirically. We find that by adding character-level supervision, the MTL model interpolates between recognizing more frequent words (preferred by the word-level model) and shorter words (preferred by the character-level model).
研究动机与目标
- 探究在小规模数据集上从零开始训练词级别ASR模型是否可行,与先前的负面发现相反。
- 分析结合词级别与字符级别监督的多任务学习如何塑造模型的归纳偏差。
- 理解在训练过程中,词识别的学习动态如何受词频与词长分布的影响。
- 确定结合词级别与字符级别监督是否能提升泛化性能,超越单一监督基线。
提出的方法
- 模型采用连接时序分类(CTC)方法,使用共享编码器和独立的词级别与字符级别输出头。
- 词级别输出基于常见词汇表定义,而字符级别输出使用标准字母表(包括空白标记)。
- 总损失为词级别与字符级别CTC损失的加权和,实现联合优化。
- 通过跟踪验证集中识别出的词的累积分布随时间的变化来监控模型训练过程。
- 通过比较训练初期识别出的词的频率与长度排名分布,分析归纳偏差。
- 使用带词典约束的束搜索解码器评估字符级别基线,并测试联合解码在词级别性能上的表现。
实验结果
研究问题
- RQ1尽管存在标签稀疏性问题,是否能够在相对较小的数据集上成功从零开始训练词级别ASR模型?
- RQ2结合词级别与字符级别监督的多任务学习在多大程度上影响模型对特定类型词汇的识别偏好?
- RQ3MTL模型在多大程度上实现了词级别与字符级别模型归纳偏差之间的插值?
- RQ4结合词级别与字符级别监督是否能带来优于任一单任务方法的泛化性能?
主要发现
- MTL模型的词错误率(WER)为23%,比字符级别基线低5个百分点,且优于仅使用词级别监督的模型。
- 与先前研究相反,本研究证明即使在小规模数据集上,从零开始训练词级别ASR模型也是可行的,其性能可与字符级别基线相媲美。
- 仅使用词级别监督的模型首先学习最频繁的词汇,表现出对高频词的强烈偏好。
- 字符级别模型更容易学习较短的词汇,且从训练初期起就能更均匀地覆盖所有词长范围。
- MTL模型结合了两种偏好,使词频与词长排名的分布更加均匀,尤其有利于罕见词与长词的识别。
- MTL模型通过确保所有识别出的词均在词汇表中,消除了未知词标记预测,从而提升了转录文本的可读性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。