Skip to main content
QUICK REVIEW

[论文解读] Lightweight and perceptually-guided voice conversion for electro-laryngeal speech

Benedikt Mayrhofer, Franz Pernkopf|arXiv (Cornell University)|Jan 7, 2026
Voice and Speech Disorders被引用 0
一句话总结

该论文将基于轻量级的 StreamVC 的语音转换模型应用于电喉语音,方法是移除音高/能量模块,采用自监督预训练并辅以感知与可懂度引导的有监督微调,在 CER 和自然性方面相对于电喉有显著提升,并且与健康语音高度接近。

ABSTRACT

Electro-laryngeal (EL) speech is characterized by constant pitch, limited prosody, and mechanical noise, reducing naturalness and intelligibility. We propose a lightweight adaptation of the state-of-the-art StreamVC framework to this setting by removing pitch and energy modules and combining self-supervised pretraining with supervised fine-tuning on parallel EL and healthy (HE) speech data, guided by perceptual and intelligibility losses. Objective and subjective evaluations across different loss configurations confirm their influence: the best model variant, based on WavLM features and human-feedback predictions (+WavLM+HF), drastically reduces character error rate (CER) of EL inputs, raises naturalness mean opinion score (nMOS) from 1.1 to 3.3, and consistently narrows the gap to HE ground-truth speech in all evaluated metrics. These findings demonstrate the feasibility of adapting lightweight voice conversion architectures to EL voice rehabilitation while also identifying prosody generation and intelligibility improvements as the main remaining bottlenecks.

研究动机与目标

  • 通过恢复自然韵律并降低机械噪声来促进电喉语音的康复
  • 基于改编的 StreamVC 架构开发一个轻量级的EL-to-HE语音转换系统
  • 研究感知与可懂度引导损失对性能的影响
  • 在不同损失配置与嘈杂条件下提供客观与主观评估

提出的方法

  • 通过省略音高与能量模块来改编 StreamVC 架构以适应 EL 语音
  • 在健康德语语音上进行自监督目标的预训练以解耦内容与说话人特征
  • 在并行的EL–HE数据上进行微调,使用感知(WavLM、WEO)与可懂度(HF、F0、BNF、WEO)引导的损失
  • 利用 Whisper 编码器输出特征通过 Whisper DTW 实现跨 domaine 的鲁棒对齐
  • 使用基于 GAN 的波形合成,具 HiFi-GAN 风格判别器;模型保持轻量级(约 3000 万参数,123 MB)
  • 在噪声条件下评价客观指标(CER、MOS 预测、SIM、F0 RMSE)与主观指标(nMOS、WER、SIM)

实验结果

研究问题

  • RQ1一个轻量级 EL-to-HE 语音转换模型是否能在可懂度与自然性方面达到与基线相当的水平?
  • RQ2感知/可懂度引导损失对 EL 语音修复的影响是什么?
  • RQ3在客观与主观衡量下,EL 转换语音离 HE 真值有多近?
  • RQ4模型在嘈杂环境下是否健壮,哪些方面仍存在瓶颈(韵律、可懂度)?

主要发现

  • 最佳配置(+WavLM+HF)相对于 EL 基线及 FreeVC、XVC 等基线在 CER 大幅下降、nMOS 提升明显
  • 客观指标在大多数量度上接近 HE 真值表现,除了 F0 RMSE 与 CER 外
  • WavLM 或 WEO 感知损失配合 HF 能在可懂度与语音质量上取得平衡的提升;增加更多损失可能影响收敛
  • 主观结果与客观趋势一致,+WavLM+HF 取得最佳自然性(nMOS)并保持良好的说话人相似性
  • 韵律生成与可懂度仍是电喉康复的主要瓶颈;未来工作将聚焦韵律改进
  • 在中高信噪比下,该方法带来明确的可懂度提升;低信噪比下非平稳噪声导致性能下降,缩小与电喉输入的差距

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。