Skip to main content
QUICK REVIEW

[论文解读] Silence is Sweeter Than Speech: Self-Supervised Model Using Silence to Store Speaker Information

Chi-Luen Feng, Po‐Chun Hsu|arXiv (Cornell University)|May 8, 2022
Speech Recognition and Synthesis被引用 6
一句话总结

本文揭示,自监督语音模型(如HuBERT)主要将说话人信息存储在音频波形中静音段对应的表征中。通过在训练数据中插入静音,模型的说话人识别准确率在不微调的情况下提升了近2%,表明静音有助于提升学习表征中说话人特征的解耦程度。

ABSTRACT

Self-Supervised Learning (SSL) has made great strides recently. SSL speech models achieve decent performance on a wide range of downstream tasks, suggesting that they extract different aspects of information from speech. However, how SSL models store various information in hidden representations without interfering is still poorly understood. Taking the recently successful SSL model, HuBERT, as an example, we explore how the SSL model processes and stores speaker information in the representation. We found that HuBERT stores speaker information in representations whose positions correspond to silences in a waveform. There are several pieces of evidence. (1) We find that the utterances with more silent parts in the waveforms have better Speaker Identification (SID) accuracy. (2) If we use the whole utterances for SID, the silence part always contributes more to the SID task. (3) If we only use the representation of a part of the utterance for SID, the silenced part has higher accuracy than the other parts. Our findings not only contribute to a better understanding of SSL models but also improve performance. By simply adding silence to the original waveform, HuBERT improved its accuracy on SID by nearly 2%.

研究动机与目标

  • 研究自监督学习(SSL)模型(如HuBERT)如何在其隐藏表征中存储说话人信息。
  • 检验语音波形中静音位置是否与说话人特异性信息的存储相关。
  • 确定在训练数据中添加静音是否能提升下游说话人识别(SID)性能。
  • 探讨不同类型的语音信息(如说话人、内容)是否在波形的时间位置上被分别存储的假设。

提出的方法

  • 使用说话人识别(SID)作为探针任务,测量HuBERT表征中的说话人信息。
  • 将语音样本分割为片段,并通过单个片段的表征评估SID准确率,以识别存储说话人信息的部分。
  • 在波形的开头或结尾插入静音,并比较静音段与语音段在SID性能上的差异。
  • 在HuBERT的加权层表征上训练线性下游分类器,以评估不同数据配置下的SID性能。
  • 系统性地改变静音长度(原语音长度的1/50、1/10、1/5),以寻找性能提升的最佳插入长度。
  • 通过随机打乱波形片段进行消融研究,以检验基于静音的表征学习的鲁棒性。

实验结果

研究问题

  • RQ1语音波形中是否存在静音是否与HuBERT表征中更高水平的说话人信息存储相关?
  • RQ2静音段的表征在说话人识别任务中是否优于语音段的表征?
  • RQ3在训练数据中插入静音是否能提升说话人识别性能,而无需微调上游SSL模型?
  • RQ4是否存在一个最优的插入静音长度,可使说话人识别准确率达到最大?

主要发现

  • 静音比例越高的语音样本,其说话人识别(SID)准确率显著更高,当静音比例低于5%时,性能下降30–50%。
  • 静音段在所有片段中始终对SID性能贡献最大,单独使用时准确率最高。
  • 在波形开头或结尾插入静音,使HuBERT base模型的SID准确率提升约2%,HuBERT-large模型的增益为0.2%。
  • 最优静音长度为原语音长度的1/10,过短或过长的插入均会降低性能。
  • 静音段被发现能聚合周围语音段的说话人信息,表明其在解耦说话人与内容表征中具有作用。
  • 研究结果表明,静音作为一种结构提示,增强了模型在自监督表征中存储和检索说话人特异性信息的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。