Skip to main content
QUICK REVIEW

[论文解读] textless-lib: a Library for Textless Spoken Language Processing

Eugene Kharitonov, Jade Copet|arXiv (Cornell University)|Feb 15, 2022
Speech and dialogue systems被引用 4
一句话总结

textless-lib 是一个基于 PyTorch 的库,通过提供用于语音转单元编码、单元建模以及单元转语音解码的模块化、可重用组件,简化了无文本语音语言处理。它支持使用预训练模型和极少代码实现端到端的研究,涵盖语音续写、音频压缩和表征探测,显著降低了 NLP 和语音研究者在低资源或非文本语音语言领域研究的门槛。

ABSTRACT

Textless spoken language processing research aims to extend the applicability of standard NLP toolset onto spoken language and languages with few or no textual resources. In this paper, we introduce textless-lib, a PyTorch-based library aimed to facilitate research in this research area. We describe the building blocks that the library provides and demonstrate its usability by discuss three different use-case examples: (i) speaker probing, (ii) speech resynthesis and compression, and (iii) speech continuation. We believe that textless-lib substantially simplifies research the textless setting and will be handful not only for speech researchers but also for the NLP community at large. The code, documentation, and pre-trained models are available at https://github.com/facebookresearch/textlesslib/ .

研究动机与目标

  • 降低设置和运行无文本语音语言处理实验的复杂性,因为目前这些实验需要多个脚本和代码仓库。
  • 通过直接从原始音频建模语音语言(无需转录或词典)来支持低资源和非书面语言的研究。
  • 通过在语音表征中建模语调、语调、非语言发声和说话人身份,将 NLP 能力扩展到文本之外。
  • 提供一个统一、易于使用的库,集成 S2U 编码器、U2U 语言模型和 U2S 解码器,实现端到端的无文本处理流水线。
  • 通过提供预训练模型和即用型示例任务,加速语音表征探测、压缩和生成方面的研究。

提出的方法

  • 该库提供了用于语音转单元(S2U)编码的模块化 PyTorch 组件,使用 HuBERT 和 CPC 等模型将原始音频映射为离散单元。
  • 通过在学习到的表征上使用 k-means 聚类实现单元量化,从而在无文本监督的情况下实现语音的离散标记化。
  • 包含预训练的 U2U 语言模型(如基于 Transformer 的模型),用于对离散单元进行序列建模,支持语音续写和情感迁移等任务。
  • 集成 Tacotron2 和 WaveGlow 等 U2S 解码器,从离散单元重建语音,实现完整的无文本语音生成和重合成。
  • 通过绕过 U2U 模型,直接实现语音重合成,支持通过单元序列和熵编码进行有损压缩和比特率分析。
  • 提供统一的 API 和示例脚本,用于探测、压缩和续写任务,使用在 LibriSpeech 和 LibriLight 数据集上预训练的模型。

实验结果

研究问题

  • RQ1一个统一的库能否显著降低无文本语音语言处理实验的工程开销?
  • RQ2自监督语音表征(如 HuBERT、CPC)在多大程度上包含说话人特异性信息?量化如何影响这一特性?
  • RQ3使用 HuBERT 的离散单元可实现多高的压缩率和语音质量权衡?这些特性如何随词表大小变化?
  • RQ4无文本语言模型在单个音频提示下,能否生成自然流畅的语音续写?
  • RQ5该库能否在无文本监督的情况下实现高质量的语音情感转换和语音转换?

主要发现

  • HuBERT 和 CPC 的连续表征包含足够的说话人特异性信息,可使用两层 Transformer 实现说话人识别,而量化后的表征则表现出更强的说话人不变性。
  • 离散化的 HuBERT 单元在 LibriLight 上实现了高达 1.5 比特每秒的压缩率,词错率(WER)为 12.3%,显示出在极端语音压缩方面的强大潜力。
  • 使用基于 wav2vec 2.0 的 S2U 模型和 KenLM 语言模型的完整 GSLM 流水线,在不同随机种子下均能生成连贯且多样的语音续写,如表 4 所示。
  • 该库通过使用 100 个单元的 HuBERT 实现了 1.5 bps 的比特率直接语音重合成,实现了压缩与重建质量之间的良好平衡。
  • 实现说话人探测、压缩和续写任务仅需几行代码,证明了该库的易用性和低入门门槛。
  • textless-lib 中的预训练模型和示例流水线已公开发布于 GitHub,支持无文本语音研究的快速原型设计和可复现性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。