Skip to main content
QUICK REVIEW

[论文解读] N-HANS: Introducing the Augsburg Neuro-Holistic Audio-eNhancement System

Shuo Liu, Gil Keren|arXiv (Cornell University)|Nov 16, 2019
Speech and Audio Processing参考文献 16被引用 4
一句话总结

N-HANS 是一个基于 TensorFlow 的 Python 工具包,用于野外音频增强,支持去噪、声源分离和选择性噪声抑制,通过一个双分支 ±辅助网络实现,该网络基于正样本和负样本参考录音进行条件控制。该工具包在 LibriSpeech 和 AudioSet 基准测试中实现了最先进性能,SDR 高达 11.86 dB,PESQ 达到 0.92,展现出在多种真实环境条件下的鲁棒性。

ABSTRACT

N-HANS is a Python toolkit for in-the-wild audio enhancement, including speech, music, and general audio denoising, separation, and selective noise or source suppression. The functionalities are realised based on two neural network models sharing the same architecture, but trained separately. The models are comprised of stacks of residual blocks, each conditioned on additional speech or environmental noise recordings for adapting to different unseen speakers or environments in real life. In addition to a Python API, a command line interface is provided to researchers and developers, both of which are documented at https://github.com/N-HANS/N-HANS. Experimental results indicate that N-HANS achieves outstanding performance, and ensure its reliable usage in real-life audio and speech-related tasks, reaching very high audio and speech quality.

研究动机与目标

  • 为解决在低信噪比和复杂声学环境中,由未见噪声和干扰源污染的真实世界音频增强挑战。
  • 开发一个统一系统,利用单一架构和共享组件,实现去噪、声源分离和选择性噪声抑制。
  • 在保留语音或环境警报等期望信号的同时,提升音频质量和可懂度。
  • 通过基于参考的条件控制实现对未见说话人和环境的适应,提升模型在训练数据之外的泛化能力。

提出的方法

  • 系统采用两个相同的残差神经网络架构,分别用于正样本和负样本参考条件控制,构成 ±辅助网络。
  • 将含噪音频、正样本参考和负样本参考的对数幅度 STFT 输入至独立分支,分别生成正样本和负样本的嵌入向量。
  • 增强网络将含噪音频输入与正负样本嵌入向量结合,生成优化后的输出信号。
  • 采用感知损失与客观损失函数的组合进行端到端训练,以保持语音自然性并最小化失真。
  • 提供命令行接口和 Python API,便于集成到语音与音频处理流水线中。
  • 系统支持与 openXBOW 和 auDeep 的插件式集成,用于音频特征提取。

实验结果

研究问题

  • RQ1单一神经网络架构是否能通过参考条件控制有效处理多种音频增强任务——去噪、分离和选择性抑制?
  • RQ2仅使用参考录音,该模型在未见说话人和环境噪声条件下的泛化能力如何?
  • RQ3与固定模型基线相比,基于参考的条件控制在低信噪比和复杂声学场景下的性能提升程度如何?
  • RQ4系统是否能在抑制目标噪声或干扰的同时,保留有用的非语音信号(如警报)?
  • RQ5信噪比变化对增强音频的主观和客观质量有何影响?

主要发现

  • 在 LibriSpeech 和 AudioSet 测试集上,N-HANS 在输入 SNR 为 10 dB 时实现了 11.86 dB 的信噪比(SDR),表明其具备强大的噪声抑制能力。
  • 在 8 dB 正负噪声下的选择性去噪任务中,系统达到 0.90 的 PESQ 分数和 12.12 dB 的 SDR,证明其具备高语音质量与鲁棒性。
  • 在 VoxCeleb 的语音分离任务中,N-HANS 在所有混合信号上实现了 4.79 dB 的 SDR,优于 Deep Clustering(0.84 dB)和 Deep Attractor(1.81 dB)。
  • 系统在高 SNR 条件下保持了高可懂度,STOI 分数达到 0.90,表明语音清晰度得到良好保留。
  • 在 10 dB SNR 条件下,梅尔倒谱失真(MCD)降低至 5.98,表明谱失真最小化,信号保真度高。
  • 系统在多种噪声类型和说话人组合下均表现出一致性能,证实其对未见环境的强泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。