Skip to main content
QUICK REVIEW

[论文解读] A Differentiable Perceptual Audio Metric Learned from Just Noticeable Differences

Pranay Manocha, Adam Finkelstein|arXiv (Cornell University)|Jan 13, 2020
Speech and Audio Processing参考文献 36被引用 5
一句话总结

本文提出了一种基于大规模众包JND判断数据集训练的可微分、基于深度学习的感知音频度量方法。通过将音频比较任务建模为带有扰动音频对的二元分类任务('相同'或'不同'),该模型能够以高精度预测人类感知,并在与人类判断的相关性以及作为语音增强训练损失方面均优于现有度量方法。

ABSTRACT

Many audio processing tasks require perceptual assessment. The ``gold standard`` of obtaining human judgments is time-consuming, expensive, and cannot be used as an optimization criterion. On the other hand, automated metrics are efficient to compute but often correlate poorly with human judgment, particularly for audio differences at the threshold of human detection. In this work, we construct a metric by fitting a deep neural network to a new large dataset of crowdsourced human judgments. Subjects are prompted to answer a straightforward, objective question: are two recordings identical or not? These pairs are algorithmically generated under a variety of perturbations, including noise, reverb, and compression artifacts; the perturbation space is probed with the goal of efficiently identifying the just-noticeable difference (JND) level of the subject. We show that the resulting learned metric is well-calibrated with human judgments, outperforming baseline methods. Since it is a deep network, the metric is differentiable, making it suitable as a loss function for other tasks. Thus, simply replacing an existing loss (e.g., deep feature loss) with our metric yields significant improvement in a denoising network, as measured by subjective pairwise comparison.

研究动机与目标

  • 解决深度学习损失函数与人类听觉感知在音频处理任务中不一致的问题。
  • 克服PESQ和ViSQOL等非可微分、人工设计度量方法在捕捉细微感知差异方面的局限性。
  • 提出一种可扩展的、数据驱动的感知音频评估方法,利用众包JND判断数据。
  • 构建一种可微分的损失函数,可直接用于端到端深度学习训练中的音频恢复任务。
  • 证明所学习的度量方法在最先进的语音增强模型中相比基线损失函数能提升感知质量。

提出的方法

  • 收集大规模众包二元判断数据('相同'或'不同'),针对经算法施加扰动(如噪声、混响、压缩)的音频对。
  • 利用主动学习方法,高效采样每段参考音频在刚好可察觉差异(JND)阈值附近的扰动强度。
  • 在该二元分类任务上训练深度神经网络,学习一个感知嵌入空间,其中距离与人类可检测差异程度相关。
  • 从学习到的网络嵌入中构建可微分的距离度量,用作下游音频处理任务中的损失函数。
  • 使用平均意见得分(MOS)和二选一强制选择(2AFC)数据集对模型进行校准,以验证其感知对齐性。
  • 将所学习的度量作为损失集成到语音增强网络中,替代或增强现有的损失函数(如L1、L2或深度特征损失)。

实验结果

研究问题

  • RQ1在众包JND判断数据上训练的深度神经网络能否生成比现有客观度量方法更符合人类感知的感知音频度量?
  • RQ2可微分的感知损失在主观听音测试中能在多大程度上提升基于深度学习的语音增强模型性能?
  • RQ3与自监督音频嵌入(如OpenL3、VGGish)相比,所提出的度量在感知对齐性和作为训练目标的实用性方面表现如何?
  • RQ4与标准损失函数或非可微分度量相比,基于JND数据训练是否能提升对细微音频退化情况的泛化能力?
  • RQ5所学习的度量能否有效捕捉人类检测阈值附近的感知差异,特别是在传统度量失效的情况下?

主要发现

  • 该度量在验证集上的2AFC准确率达到83.9%,显著优于PESQ(86.1%)和ViSQOL(84.2%)在偏好测试中的表现,表明其具有更优的感知对齐性。
  • 在语音增强任务中,使用该损失的模型在83.9%的成对比较中获得偏好(vs. 基线),且具有统计显著性(p < 10^-4),尤其在高信噪比条件下,细微差异更为关键。
  • 该度量与人类MOS评分的相关性优于传统度量(如PESQ和ViSQOL),甚至在感知一致性方面超越了自监督嵌入(如OpenL3)。
  • 当用作去噪网络中的损失时,该度量相比L1、L2和深度特征损失能产生更具感知优势的结果,经人工评估验证。
  • 在JND数据上训练的模型学习到了感知校准的尺度,纠正了在分类任务预训练模型中常见的错误感知排序问题。
  • 该数据集、代码和训练好的模型已公开发布,支持可复现性,并推动其在音频机器学习研究中的广泛应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。