Skip to main content
QUICK REVIEW

[论文解读] Clarity: Machine Learning Challenges to Revolutionise Hearing Device Processing

Simone Graetzer, Michael A. Akeroyd|arXiv (Cornell University)|Jun 19, 2020
Hearing Loss and Rehabilitation被引用 4
一句话总结

Clarity 项目启动了开放、公开的机器学习挑战,旨在提升助听设备中的语音处理性能,并预测听力受损人群的语音可懂度。通过提供开放数据集、基线模型和基础设施,该项目使研究人员能够开发因果性、实时的助听器信号处理与预测算法,关键成果包括新型开源工具、一个英式英语语音-噪声数据库,以及提升真实世界助听器性能的改进算法。

ABSTRACT

In the Clarity project, we will run a series of machine learning challenges to revolutionise speech processing for hearing devices. Over five years, there will be three paired challenges. Each pair will consist of a competition focussed on hearing-device processing ("enhancement") and another focussed on speech perception modelling ("prediction"). The enhancement challenges will deliver new and improved approaches for hearing device signal processing for speech. The parallel prediction challenges will develop and improve methods for predicting speech intelligibility and quality for hearing impaired listeners. This Engineering and Physical Sciences Research Council (EPSRC) funded project involves researchers from the Universities of Sheffield, Salford, Nottingham and Cardiff in conjunction with the Hearing Industry Research Consortium, Action on Hearing Loss, Amazon, and Honda. To register interest in the challenges, go to www.claritychallenge.org.

研究动机与目标

  • 解决听力受损个体在噪声环境中语音感知的严峻挑战,这是导致助听器使用率低下的主要原因。
  • 通过为机器学习和信号处理研究人员提供可访问的开放资源,克服听力损伤研究兴趣有限的障碍。
  • 通过公开竞赛,利用深度学习和自动语音识别的最新进展,彻底革新助听设备处理技术。
  • 开发能够准确反映不同听音环境中真实世界助听器性能的语音可懂度预测模型。
  • 通过提供开放获取的数据、模型和基础设施,建立可持续的长期听力技术研究生态系统。

提出的方法

  • 组织成对的机器学习挑战:一项聚焦于助听器信号增强(因果处理),另一项聚焦于预测听力受损人群的语音可懂度。
  • 使用空间化音频生成工具生成逼真的双耳语音-噪声信号,模拟带有混响和非语音干扰源(如电视)的客厅环境。
  • 提供听力损失、助听器处理和语音感知的基线模型,以统一评估标准并降低参与门槛。
  • 通过平板电脑和耳机在家庭环境中对50名参与者(含听力受损与未受损者)组成的听觉测试小组进行语音可懂度评分收集。
  • 基于测试信号的平均可懂度得分评估信号增强类参赛作品;通过预测值与实测可懂度之间的均方误差评估预测类参赛作品。
  • 通过尽可能要求系统开源并强制使用提供的音频文件和信号生成工具,确保可复现性和可访问性。

实验结果

研究问题

  • RQ1如何开发机器学习模型,以在真实、嘈杂、混响的条件下显著提升助听设备中的语音可懂度?
  • RQ2基于信号处理和听者特征,预测模型在多大程度上能准确估算听力受损人群的语音可懂度?
  • RQ3开放获取的数据集、工具和基础设施在加速助听设备技术革新和扩大研究人员参与方面发挥什么作用?
  • RQ4具有标准化基准和评估协议的公开挑战能否带来助听器信号处理和感知建模的可衡量改进?
  • RQ5如何将自动语音识别领域的深度学习和数据驱动方法适配并验证于听力损伤应用场景?

主要发现

  • Clarity 项目于2020年11月成功启动第一轮机器学习挑战,其测试版于2020年10月发布。
  • 共50名具有不同程度听力损伤的听者参与了家庭环境下的听音测试,提供了用于评估的实测语音可懂度得分。
  • 该项目交付了开放获取的数据集,包括在无回声条件下录制的英式英语语音录音,以及具有逼真房间声学特性的空间化语音-噪声信号。
  • 已开发并公开发布了听力损失、助听器处理和语音感知的基线模型,以支持一致的基准测试。
  • 通过创建可重用的工具用于生成人工听者档案和双耳音频信号,项目建立了可持续的未来挑战框架。
  • 通过提供全面的基础设施,该项目成功降低了研究者的参与门槛,使即使不具备听力技术背景的研究人员也能参与。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。