[论文解读] Audio Transport: A Generalized Portamento via Optimal Transport
本文提出音频传输(audio transport),一种实时音频效果,通过求解一维最优传输问题,将任意两个音频信号之间的音高进行映射,从而生成类似弯音(portamento)的音乐过渡效果。该方法可在单音和多音声音之间实现平滑、符合音乐直觉的滑音过渡,包括不同乐器之间的转换,且对各种输入信号均具有极低的失真。
This paper proposes a new method to interpolate between two audio signals. As an interpolation parameter is changed, the pitches in one signal slide to the pitches in the other, producing a portamento, or musical glide. The assignment of pitches in one sound to pitches in the other is accomplished by solving a 1-dimensional optimal transport problem. In addition, we introduce several techniques that preserve the audio fidelity over this highly non-linear transformation. A portamento is a natural way for a musician to transition between notes, but traditionally it has only been possible for instruments with a continuously variable pitch like the human voice or the violin. Audio transport extends the portamento to any instrument, even polyphonic ones. Moreover, the effect can be used to transition between different instruments, groups of instruments, or really any transient-less audio signals. The audio transport effect operates in real-time; we open-source implementation is provided. In experiments with sinusoidal inputs, the interpolating effect is indistinguishable from ideal sine sweeps. In general, the effect produces clear, musical results for a wide variety of inputs.
研究动机与目标
- 开发一种实时音频效果,实现任意音频信号之间富有表现力的、类似弯音的过渡,将音乐滑音效果扩展至传统连续音高乐器之外的范围。
- 解决在高度非线性插值过程中,将一个音频信号的音高映射到另一个信号时,保持音频保真度和音乐性的挑战。
- 首次将最优传输理论应用于音频合成,实现自动化的、参数化的插值,并通过单一插值参数实现直观控制。
- 解决在复杂或对比鲜明的音色之间进行谱域插值时出现的失真问题,如音量衰减和相位失真。
- 使该效果适用于多音和非单音信号,克服传统弯音或相位谱分析方法的局限性。
提出的方法
- 该方法使用一维最优传输计算位移映射,将源信号的频率分量映射到目标信号的对应分量,以最小化Wasserstein-2距离。
- 在传输前,通过时频重分配将音频频谱划分为具有感知意义的成分,以改善对齐效果并减少失真。
- 将相位累积扩展至分析帧之间,以保持相位连续性,防止插值过程中的拍频失真。
- 在时频域中通过改进的短时傅里叶变换(STFT)执行插值,利用传输映射后的谱图重新合成幅度和相位。
- 关键创新在于使用单一插值参数 k ∈ [0,1] 控制源谱与目标谱的混合,通过最优传输映射实现。
- 该方法通过依赖频谱能量分布和基于传输的分配,避免了手动音高追踪,从而实现对复杂信号的全自动处理。
实验结果
研究问题
- RQ1最优传输能否用于自动生成任意音频信号之间(包括多音和音色差异显著的声音)音乐协调的弯音效果?
- RQ2如何调整最优传输方法,以在高度非线性谱插值过程中保持音频保真度并最小化感知失真?
- RQ3时频重分配在提升基于传输的音频插值感知质量方面起到什么作用?
- RQ4当单个频率在源信号中映射到目标信号中一个宽频带时,该方法如何处理谱能量抵消和音量衰减问题?
- RQ5该基于传输的效果能否实现实时处理且延迟极低,从而适用于现场表演和交互式音乐系统?
主要发现
- 音频传输效果产生平滑、音乐化的弯音过渡,在正弦信号输入情况下,其感知效果与理想的正弦扫频几乎无法区分。
- 对于广泛的音频输入——包括单音和多音声音、不同乐器,甚至整首歌曲——该效果均产生清晰、无失真且音乐协调的结果。
- 当源信号中的单个频率映射到目标信号中一个宽频带时,会出现音量衰减,尤其在两个信号的谱复杂度显著不同时更为明显。
- 由于FFT分辨率限制,频率过渡中会出现“阶梯状”失真,但其时间-频率尺度极小,在听音测试中不可察觉。
- 瞬态信号(如军鼓)因谱混叠而变得模糊,当存在瞬态时,直接对比中原始信号始终优于输出信号。
- 该效果支持实时处理,并可通过MIDI或其他控制源进行控制,支持现场表演集成与基于反馈的声音设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。