[论文解读] Sound texture synthesis using convolutional neural networks
本文提出了一种新颖的参数化声音纹理合成方法,采用二维卷积神经网络(CNN)通过匹配目标纹理的对数谱图特征图之间的时序互相关性,直接在时域优化时间域信号。该方法避免了相位恢复,直接在时域进行操作,无需针对每种纹理调整超参数,即可实现高质量的多样化纹理合成,包括具有奇异事件的纹理。
The following article introduces a new parametric synthesis algorithm for sound textures inspired by existing methods used for visual textures. Using a 2D Convolutional Neural Network (CNN), a sound signal is modified until the temporal cross-correlations of the feature maps of its log-spectrogram resemble those of a target texture. We show that the resulting synthesized sound signal is both different from the original and of high quality, while being able to reproduce singular events appearing in the original. This process is performed in the time domain, discarding the harmful phase recovery step which usually concludes synthesis performed in the time-frequency domain. It is also straightforward and flexible, as it does not require any fine tuning between several losses when synthesizing diverse sound textures. A way of extending the synthesis in order to produce a sound of any length is also presented, after which synthesized spectrograms and sound signals are showcased. We also discuss on the choice of CNN, on border effects in our synthesized signals and on possible ways of modifying the algorithm in order to improve its current long computation time.
研究动机与目标
- 开发一种灵活的参数化声音纹理合成方法,能够再现包括非平稳纹理和具有奇异前景事件的纹理在内的多种纹理。
- 通过利用深度学习克服现有方法(如基于物理或颗粒合成)的局限性,提升方法的适用范围和感知质量。
- 通过直接在时域进行优化,避免相位恢复,提高鲁棒性并简化合成流程。
- 实现在无需针对每种纹理调整超参数的前提下,实现长时长合成与参数调控。
- 通过架构和表示层面的改进,解决合成信号中的计算效率低下和边界伪影问题。
提出的方法
- 该方法使用2D CNN从目标声音纹理的对数谱图中提取特征图,并计算这些特征图之间的时序互相关性,作为参数化描述符。
- 通过梯度下降迭代优化一个随机初始化的时域信号,使其合成信号的特征图互相关性与目标信号的互相关性差异最小化。
- 优化过程直接在时域进行,避免了时频域合成中通常需要的相位重建步骤。
- 网络使用随机初始化的未训练卷积核,以保持对多样化纹理的灵活性,且无需为每种新纹理进行微调。
- 通过将优化过程扩展至原始信号长度之外,实现长时长合成,保持时序一致性。
- 通过裁剪输出的初始和末尾部分来缓解边界效应,因为伪影具有局部性且向内迅速衰减。
实验结果
研究问题
- RQ1CNN特征图的时序互相关性能否作为参数化声音纹理合成的有效、通用的参数?
- RQ2使用这些参数在时域进行优化,能否在不进行相位恢复的情况下生成高质量、感知上可信的纹理?
- RQ3该方法能否合成同时包含随机背景事件和明显可识别的前景事件的纹理?
- RQ4如何将该方法扩展为生成任意长的声音纹理,同时保持感知质量?
- RQ5哪些架构和表示选择可以在不降低合成质量的前提下减少计算时间?
主要发现
- 该方法成功合成了多种类别中高质量的声音纹理,包括风声、雨声、鸟鸣和火焰声,即使在包含明显前景事件的纹理中也表现良好。
- 合成信号在感知上与原始信号有明显区别,但保留了核心纹理特征,实现了重新合成的目标。
- 该算法无需针对每种纹理进行超参数调优,因此在不同纹理类型之间具有高度的简便性和灵活性。
- 合成信号的起始和结尾处出现边界伪影,持续时间约为最大卷积核大小(27帧),但伪影具有局部性,可通过裁剪去除。
- 计算时间仍然较高(在单张GPU上生成12秒音频约需1小时),但可通过将参数张量下采样至约1600万参数(从约1亿参数)来降低。
- 该方法在对数谱图中相距较远的事件之间相关性的再现能力有限,表明其在长时序建模方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。