QUICK REVIEW
[论文解读] Wav2Letter: an End-to-End ConvNet-based Speech Recognition System
Ronan Collobert, Christian Puhrsch|arXiv (Cornell University)|Sep 11, 2016
Speech Recognition and Synthesis参考文献 24被引用 248
一句话总结
本文提出一个端到端的基于 ConvNet 的声学模型,使用 AutoSegCriterion (ASG) 进行字母表(grapheme)基础的语音识别,并配备一个简单的束搜索解码器,在没有强制对齐或 HMM/GMM 流水线的情况下在 LibriSpeech 上取得具有竞争力的结果。
ABSTRACT
This paper presents a simple end-to-end model for speech recognition, combining a convolutional network based acoustic model and a graph decoding. It is trained to output letters, with transcribed speech, without the need for force alignment of phonemes. We introduce an automatic segmentation criterion for training from sequence annotation without alignment that is on par with CTC while being simpler. We show competitive results in word error rate on the Librispeech corpus with MFCC features, and promising results from raw waveform.
研究动机与目标
- 消除在 ASR 中对强制对齐的音素转写的需求,直接在字母上进行训练。
- 提出一个简单的端到端架构,使用一维卷积神经网络和基于图的分割准则。
- 在 LibriSpeech 上展示用 MFCC、功率谱和原始波形输入的具有竞争力的字错误率。
- 表明 ASG 在速度和准确性上可与 CTC 相匹配或超越标准基准。
提出的方法
- 使用一维卷积神经网络作为声学模型,将输入特征(MFCC、功率谱或原始波形)映射到字母分数。
- 引入 AutoSegCriterion (ASG),一种基于图的分割准则,具有未归一化的节点分数和全局归一化,避免空白标签。
- 使用 ASG 通过时间展开的图训练,利用类似于 CTC 的 logadd 操作优化前向分数,但不包含空白。
- 整合一个简单的一遍束搜索解码器,带语言模型集成(KenLM)和单词插入惩罚。
- 使用 16 kHz 音频、30 字母表(包括撇号、静音和重复标记),评估 LibriSpeech,并将 ASG 与 CTC 进行比较。
实验结果
研究问题
- RQ1在无强制对齐的情况下,端到端基于字母的声学模型是否能在 LibriSpeech 上达到具有竞争力的 WER?
- RQ2ASG 是否在不使用空白标签的序列标注方面提供与 CTC 相同或更好的性能和速度?
- RQ3在该架构下,MFCC、功率谱和原始波形输入在端到端字母 ASR 中的比较?
- RQ4数据增强和训练规模对 ASG 性能的影响?
- RQ5具有外部语言模型的简单解码器在标准基准上的表现如何?
主要发现
- ASG 在相同数据上、在 CPU 上实现时达到可比的 LER,与 CTC 相比,对较长序列更快。
- 在 LibriSpeech 上,基于 MFCC 的模型在 dev-clean 与 test-clean 上分别达到约 6.9% 的 LER 和 ~7.2% 的 WER(报道的最佳结果)。
- 功率谱和原始波形输入产生的 LER/WER 高于 MFCC,但仍具竞争力,数据量增加时有改进。
- 数据增强在较小的训练集上帮助更大;数据量大时,MFCC 与功率谱表现相近。
- 所提出的端到端系统在没有 HMM/GMM 强制对齐的情况下运行高效(例如,解码显著快于某些基线的 RNN 系统)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。