Skip to main content
QUICK REVIEW

[论文解读] End-to-End Whisper to Natural Speech Conversion using Modified Transformer Network

Abhishek Niranjan, Mukesh Sharma|arXiv (Cornell University)|Apr 20, 2020
Speech Recognition and Synthesis参考文献 29被引用 6
一句话总结

本文提出了一种基于增强Transformer的端到端语音转换框架,用于将耳语转换为自然语音,通过引入辅助解码器实现帧级音素预测,并利用并行与非并行数据进行训练。当将转换后的语音输入到端到端自动语音识别(E2E ASR)系统时,该方法在wTIMIT和CHAINS数据集上实现了65%的词错误率(WER)相对降低,且通过一种新型的共振峰差异度量方法,其共振峰分布与真实值高度一致。

ABSTRACT

Machine recognition of an atypical speech like whispered speech, is a challenging task. We introduce whisper-to-natural-speech conversion using sequence-to-sequence approach by proposing enhanced transformer architecture, which uses both parallel and non-parallel data. We investigate different features like Mel frequency cepstral coefficients and smoothed spectral features. The proposed networks are trained end-to-end using supervised approach for feature-to-feature transformation. Further, we also investigate the effectiveness of embedded auxillary decoder used after N encoder sub-layers, trained with the frame-level objective function for identifying source phoneme labels. We show results on opensource wTIMIT and CHAINS datasets by measuring word error rate using end-to-end ASR and also BLEU scores for the generated speech. Alternatively, we also propose a novel method to measure spectral shape of it by measuring formant distributions w.r.t. reference speech, as formant divergence metric. We have found whisper-to-natural converted speech formants probability distribution is similar to the groundtruth distribution. To the authors' best knowledge, this is the first time enhanced transformer has been proposed, both with and without auxiliary decoder for whisper-to-natural-speech conversion and vice versa.

研究动机与目标

  • 通过将耳语转换为自然语音,提升自动语音识别(ASR)中耳语的可懂度。
  • 通过利用并行与非并行训练数据,缓解非典型语音识别中的数据稀缺问题。
  • 通过在训练过程中嵌入辅助解码器,增强标准Transformer架构以实现帧级音素识别。
  • 通过E2E ASR的WER和基于共振峰差异度量的谱相似性,评估所提模型的有效性。
  • 展示双向转换能力,包括自然语音到耳语转换作为次要实验。

提出的方法

  • 提出一种增强型Transformer网络,在N个编码器子层之后插入辅助解码器,采用帧级音素分类目标进行训练。
  • 该模型执行序列到序列的特征转换,将k个输入帧(耳语)映射为k个输出帧(自然语音),支持在线转换。
  • 评估了两种特征类型:梅尔频率倒谱系数(MFCCs)和平滑谱特征,其中MFCCs表现出更优性能。
  • 通过在并行与非并行数据上进行端到端监督学习,缓解数据稀缺问题。
  • 使用一种新型的共振峰差异度量(FDM)来衡量谱形相似性,该度量基于共振峰F1–F4的高斯混合模型(GMMs)之间的KL散度。
  • 使用WORLD声码器从转换后的声学特征中合成自然语音,用于评估。

实验结果

研究问题

  • RQ1与标准模型相比,采用辅助解码器的增强型Transformer是否能显著提升耳语到自然语音转换的质量?
  • RQ2在低资源非典型语音设置下,结合并行与非并行数据是否能显著提升模型性能?
  • RQ3通过谱相似性度量,转换后的语音在多大程度上保留了目标语音的共振峰分布?
  • RQ4当通过E2E ASR系统解码时,转换后语音的性能与原始耳语相比如何?
  • RQ5所提出的架构能否有效应用于反向任务——自然语音到耳语转换,从而证明其双向能力?

主要发现

  • 在wTIMIT测试集上,基于MFCC的W2模型(带辅助解码器)在E2E ASR系统中实现了65%的WER相对降低,显著优于原始耳语语音。
  • 在CHAINS数据集上,W2模型相对于基线耳语输入将WER降低了约65%,尽管插入率略高,略微降低了整体准确率。
  • W2模型在wTIMIT测试集上取得85.36的BLEU分数,在CHAINS上取得62.68,表明生成语音具有高度流畅性和语义相似性。
  • 共振峰差异度量(FDM)显示,W2生成语音与真实值的差异更低(F1: 0.1034),而基线W1为(F1: 0.1543),表明其谱形保真度更优。
  • 辅助解码器显著提升了性能,W2和V2模型(带辅助解码)在WER和FDM指标上均优于W1和V1(无辅助解码)。
  • 频谱图与共振峰分析表明,W2生成的语音在谱包络和共振峰轨迹上与自然语音高度一致,尤其在F1和F2上表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。