[论文解读] Non-intrusive speech intelligibility prediction using automatic speech recognition derived measures
本文提出Nori,一种非侵入式语音可懂度估计算法,通过利用自动语音识别(ASR)衍生的度量指标,在无需干净参考信号的情况下预测词级可懂度。该方法结合了基于ASR的离散度与盲估计的信噪比(SNR),在多种噪声条件下预测正常听力及听力受损听者的表现时,优于广泛使用的STOI指标。
The estimation of speech intelligibility is still far from being a solved problem. Especially one aspect is problematic: most of the standard models require a clean reference signal in order to estimate intelligibility. This is an issue of some significance, as a reference signal is often unavailable in practice. In this work, therefore a non-intrusive speech intelligibility estimation framework is presented. In it, human listeners' performance in keyword recognition tasks is predicted using intelligibility measures that are derived from models trained for automatic speech recognition (ASR). One such ASR-based and one signal-based measure are combined into a full framework, the proposed NO-Reference Intelligibility (Nori) estimator, which is evaluated in predicting the performance of both normal-hearing and hearing-impaired listeners in multiple noise conditions. It is shown that the Nori framework even outperforms the widely used reference-based (or intrusive) short-term objective intelligibility (STOI) measure in most considered scenarios, while being applicable in fully blind scenarios with no reference signal or transcription, creating perspectives for online and personalized optimization of speech enhancement systems.
研究动机与目标
- 开发一种无需干净参考信号的非侵入式语音可懂度预测框架,以支持实时和个性化的语音增强。
- 改进现有侵入式方法(如STOI),后者在助听器处理中常见的非线性失真或混响条件下表现不佳。
- 通过在模型中引入听力损失效应,实现对听力受损听者可懂度的准确预测,尽管当前模型结构较为简单。
- 在小词汇量、基于矩阵句子的数据集(Grid语料库)上评估该框架,并展示其向大词汇量场景扩展的潜力。
- 为大规模数据和在线学习应用中评估语音处理算法,提供一种可靠、无需参考的替代人工听音测试的方法。
提出的方法
- 在干净语音数据上训练自动语音识别(ASR)模型,从声学模型输出中提取判别性特征,特别是音素上后验概率的离散度。
- 将ASR后验概率的离散度用作非侵入式可懂度度量,反映ASR系统对词语区分能力的强弱。
- 使用噪声估计算法从降质语音信号中盲估计信噪比(SNR),作为第二个非侵入式预测因子。
- 通过在人工听音测试数据上训练的加权线性模型,将ASR衍生的离散度与估计的SNR结合,生成单一可懂度分数。
- 在多种噪声条件下人类关键词识别表现的数据集上训练最终的Nori估计算法,使用组合特征作为预测变量。
- 在推理阶段将训练好的Nori模型应用于未见测试数据,预测词级可懂度,且推理过程中不访问任何干净参考信号。
实验结果
研究问题
- RQ1能否开发一种非侵入式语音可懂度估计算法,在无法获取干净参考信号的情况下仍能可靠运行?
- RQ2在多种噪声条件下,所提出的Nori框架在预测词级可懂度方面与广泛使用的STOI指标相比表现如何?
- RQ3即使采用简化的听力损失模型,Nori框架能否准确预测听力受损听者的可懂度表现?
- RQ4ASR衍生特征(如后验概率离散度和盲SNR估计)在实现准确可懂度预测中的贡献程度如何?
- RQ5Nori框架是否可推广至大词汇量语音识别任务?此类扩展所需的数据要求是什么?
主要发现
- 在大多数测试的噪声条件下,Nori框架在预测正常听力听者词级可懂度方面优于STOI指标,尤其在低信噪比和复杂环境条件下表现更优。
- 在预测关键词识别得分方面,Nori与人类表现的相关性(以NCC、τ和RMSE衡量)高于STOI,尤其在字母和数字等困难词类上表现更优。
- 对于听力受损听者,Nori在平均性能上与STOI相当,且在部分条件下略占优势,尽管STOI并非专为听力受损听者设计。
- 该框架在无需任何参考信号的情况下成功实现了词级可懂度预测,证明了非侵入式、实时评估语音增强系统可行性。
- Nori的性能对底层ASR系统的鲁棒性较为敏感,表明ASR准确性的提升将进一步增强可懂度预测能力。
- 该框架可扩展至大词汇量场景,但需收集大规模、经人工标注的语音数据集,并附带听音测试结果,以实现可靠评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。