Skip to main content
QUICK REVIEW

[论文解读] Overview of Tasks and Investigation of Subjective Evaluation Methods in Environmental Sound Synthesis and Conversion

Yuki Okamoto, Keisuke Imoto|arXiv (Cornell University)|Aug 27, 2019
Music and Audio Processing参考文献 17被引用 6
一句话总结

本文综述了环境音合成与转换任务,聚焦于统计生成模型(如WaveNet),并提出了一套多维主观评估框架。通过可懂性、可区分性与自然度指标评估合成音质,发现基于WaveNet的合成仍存在感知质量不足的问题,尤其在电须刨等复杂声音上表现明显,建议结合多种评估方法以实现稳健评估。

ABSTRACT

Synthesizing and converting environmental sounds have the potential for many applications such as supporting movie and game production, data augmentation for sound event detection and scene classification. Conventional works on synthesizing and converting environmental sounds are based on a physical modeling or concatenative approach. However, there are a limited number of works that have addressed environmental sound synthesis and conversion with statistical generative models; thus, this research area is not yet well organized. In this paper, we review problem definitions, applications, and evaluation methods of environmental sound synthesis and conversion. We then report on environmental sound synthesis using sound event labels, in which we focus on the current performance of statistical environmental sound synthesis and investigate how we should conduct subjective experiments on environmental sound synthesis.

研究动机与目标

  • 整理并明确环境音合成与转换的问题定义及应用场景,尤其在深度学习背景下的应用。
  • 解决环境音合成缺乏标准化评估方法的问题,特别是主观评估方法的缺失。
  • 探究统计生成模型(特别是WaveNet)在合成环境音方面的当前表现。
  • 提出一个包含可懂性、可区分性与自然度的多维评估框架,用于评估合成的环境音。
  • 通过识别评估实践中的空白点并推荐主观测试的最佳实践,为未来研究提供指导。

提出的方法

  • 在受控环境中,使用高保真音频设备(Roland UA-55接口与SONY MDR-CD900ST耳机),对24名受试者开展主观评估实验。
  • 实施三项独立的主观测试:(1) 通过基于召回率的声音事件分类评估可懂性,(2) 通过AB偏好测试评估可区分性,(3) 通过5分制平均意见得分(MOS)评估自然度。
  • 采用基于WaveNet的模型,从声音事件或场景标签合成环境音,重点关注真实感与感知保真度。
  • 使用标准心理物理学测试协议收集并分析数据,包括随机呈现真实与合成声音。
  • 通过多个指标对比合成音与真实环境音的表现,以评估感知质量与真实感。
  • 采用频谱图分析,将感知差异与频谱特征相关联,尤其关注误分类或自然度低的声音。

实验结果

研究问题

  • RQ1基于WaveNet的模型在合成可被感知为特定声音事件的环境音方面表现如何?
  • RQ2在偏好测试中,听者在多大程度上能区分真实与合成的环境音?
  • RQ3听者在5分制MOS量表上如何评价合成环境音的自然度,与真实声音相比如何?
  • RQ4当前统计生成模型(如WaveNet)在再现复杂环境音精细频谱结构方面存在哪些局限性?
  • RQ5哪一组主观评估指标的组合能为环境音合成质量提供最具信息量的评估?

主要发现

  • 声音事件分类(可懂性)的平均F值为:真实声音86.22%,合成声音76.30%,表明合成鼓声识别度较高,而杯碰撞声与电须刨声常被误分类。
  • 在可区分性AB测试中,听者正确识别真实声音的准确率为82.71%,表明基于WaveNet的合成音与真实音在感知上仍可区分。
  • 自然度的平均意见得分(MOS)显示,合成咖啡研磨机、钟表与沙锤声音的评分与真实声音相近,但电须刨与垃圾桶敲打声的评分显著偏低。
  • 频谱图分析显示,合成电须刨声音缺乏精细的频谱结构,导致与撕纸声等相似声音混淆。
  • 研究发现,仅依靠可懂性不足以评估合成质量,因为部分声音虽被正确分类但评分自然度低,凸显多指标评估的必要性。
  • 结果支持:评估环境音合成不仅应关注可懂性,还应涵盖可区分性与自然度,以确保感知真实感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。