Skip to main content
QUICK REVIEW

[论文解读] Vector-Quantized Timbre Representation

Adrien Bitton, Philippe Esling|arXiv (Cornell University)|Jul 13, 2020
Music and Audio Processing参考文献 22被引用 5
一句话总结

本文提出了一种基于VQ-VAE的自编码器,可学习到与音量解耦的、分离的离散潜在表征,用于个体音色,从而实现灵活的音色迁移和基于描述符的合成。通过将频谱特征量化到码书并映射到声学描述符,该模型实现了对声音合成的直观、高层级控制,包括基于语音的音色迁移和一致的频谱整形。

ABSTRACT

Timbre is a set of perceptual attributes that identifies different types of sound sources. Although its definition is usually elusive, it can be seen from a signal processing viewpoint as all the spectral features that are perceived independently from pitch and loudness. Some works have studied high-level timbre synthesis by analyzing the feature relationships of different instruments, but acoustic properties remain entangled and generation bound to individual sounds. This paper targets a more flexible synthesis of an individual timbre by learning an approximate decomposition of its spectral properties with a set of generative features. We introduce an auto-encoder with a discrete latent space that is disentangled from loudness in order to learn a quantized representation of a given timbre distribution. Timbre transfer can be performed by encoding any variable-length input signals into the quantized latent features that are decoded according to the learned timbre. We detail results for translating audio between orchestral instruments and singing voice, as well as transfers from vocal imitations to instruments as an intuitive modality to drive sound synthesis. Furthermore, we can map the discrete latent space to acoustic descriptors and directly perform descriptor-based synthesis.

研究动机与目标

  • 开发一种与音量无关的、分离的、离散的音色潜在表征。
  • 实现在不同音频源(包括管弦乐器和人声)之间灵活的音色迁移。
  • 通过将离散潜在向量映射到声学属性,支持高层级、基于描述符的声音合成。
  • 通过将人声模仿迁移至乐器音色,实现基于语音的合成控制。
  • 提供可解释的、分离的音色特征潜在表征,以支持直接音频合成。

提出的方法

  • 在原始波形上训练VQ-VAE自编码器,以学习代表目标音色短时频谱特征的离散潜在码书。
  • 模型使用基于RNN的解码器,通过重叠-相加减法合成生成音频,利用从潜在向量导出的系数对噪声激励进行滤波。
  • 显式地将音量从潜在空间中解耦,以确保音色迁移能独立保留音高和音量。
  • 学习离散潜在向量与声学描述符(如频谱质心、带宽)之间的映射,以实现对合成的直接控制。
  • 通过将任意输入信号编码为学习到的离散潜在码,再使用特定音色的模型进行解码,实现音色迁移。
  • 模型支持可变长度输入信号,并在乐器间迁移和人声模仿到乐器的迁移任务上进行评估。

实验结果

研究问题

  • RQ1能否从原始波形中学习到与音量无关的、离散的、分离的音色潜在表征?
  • RQ2该表征能否实现在不同音频源(包括人声和管弦乐器)之间高保真度的音色迁移?
  • RQ3该离散潜在空间能否映射到声学描述符,以实现直接的、基于描述符的声音合成?
  • RQ4人声模仿能否有效用作音色合成的控制信号?
  • RQ5该模型在音色迁移过程中是否能保持基频和音量,确保感知一致性?

主要发现

  • 该模型成功实现了管弦乐器与人声之间的音色迁移,基频和音量重建误差较低,表明音高和动态特性得到良好保留。
  • 人声模仿被有效迁移至乐器音色,证明了无需精确音高的输入即可实现基于语音的音色合成的可行性。
  • 离散潜在空间可实现与声学描述符(如频谱质心和带宽)的直接映射,从而通过基于描述符的合成实现一致的频谱整形。
  • 该模型使用减法合成生成了高质量音频,对信号类型和时长无限制,并在不同迁移任务中保持了感知一致性。
  • 潜在向量与声学描述符之间的映射表明,码书中的索引位置与声学相似性无相关性,证实了学习描述符映射的必要性。
  • 通过在潜在投影过程中丢弃声学不一致的特征,该模型实现了类似去噪的鲁棒性,提升了在多样化录音条件下的迁移性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。