[论文解读] Contextual Semi-Supervised Learning: An Approach To Leverage Air-Surveillance and Untranscribed ATC Data in ASR Systems
本文提出了一种上下文感知的自监督学习(SSL)框架,将空中监视数据整合到自动语音识别(ASR)训练中,以提升航空交通管制(ATC)通信中的呼号识别性能。通过从实时监视数据中提取的口语化呼号构建偏置WFST,并在SSL过程中应用语言模型重打分,该方法在噪声测试集上实现了17.5%的相对CA-WER改进,证明了在低资源ATC ASR场景下的显著性能提升。
Air traffic management and specifically air-traffic control (ATC) rely mostly on voice communications between Air Traffic Controllers (ATCos) and pilots. In most cases, these voice communications follow a well-defined grammar that could be leveraged in Automatic Speech Recognition (ASR) technologies. The callsign used to address an airplane is an essential part of all ATCo-pilot communications. We propose a two-steps approach to add contextual knowledge during semi-supervised training to reduce the ASR system error rates at recognizing the part of the utterance that contains the callsign. Initially, we represent in a WFST the contextual knowledge (i.e. air-surveillance data) of an ATCo-pilot communication. Then, during Semi-Supervised Learning (SSL) the contextual knowledge is added by second-pass decoding (i.e. lattice re-scoring). Results show that `unseen domains' (e.g. data from airports not present in the supervised training data) are further aided by contextual SSL when compared to standalone SSL. For this task, we introduce the Callsign Word Error Rate (CA-WER) as an evaluation metric, which only assesses ASR performance of the spoken callsign in an utterance. We obtained a 32.1% CA-WER relative improvement applying SSL with an additional 17.5% CA-WER improvement by adding contextual knowledge during SSL on a challenging ATC-based test set gathered from LiveATC.
研究动机与目标
- 为解决实际部署中手动转录的ATC语音数据稀缺问题,该问题限制了自动语音识别(ASR)系统的表现。
- 通过利用来自空中监视数据的上下文知识,提升ATC通信中关键标识符——呼号的ASR识别准确率。
- 探究在未见或低资源机场场景下,是否可通过整合实时上下文信息来增强自监督学习的效果。
- 提出并验证一种新的评估指标——呼号词错误率(CA-WER),以更准确地评估呼号识别性能。
- 展示该方法在多样化机场及复杂声学条件下的可扩展性。
提出的方法
- 针对每个ATC语音片段,从OpenSky Network空中监视数据中提取口语化呼号的n-gram序列,构建偏置WFST。
- 通过第二次遍历的语言模型重打分,将偏置WFST集成到自监督学习流程中,修改解码图以优先选择正确的呼号序列。
- 在WFST中使用折扣参数控制偏置强度,最优值通过实验确定(例如,5.0为最佳性能参数)。
- 在多个ASR系统和测试集上应用该方法,包括LiveATC、布拉格和维也纳机场的噪声和清晰录音。
- 利用未转录的VHF录音作为伪标签数据用于SSL,同时在解码过程中利用空中监视数据注入上下文知识。
- 使用标准WER和所提出的CA-WER指标评估结果,重点关注呼号识别的准确率。
实验结果
研究问题
- RQ1来自空中监视数据的上下文知识是否能改善在转录数据有限的低资源ATC设置下的ASR性能?
- RQ2在自监督学习过程中整合上下文知识是否能带来优于独立SSL的呼号识别效果?
- RQ3该方法在未在监督训练数据中出现过的未知机场上的表现如何?
- RQ4呼号词错误率(CA-WER)是否比标准WER更具有意义,能更准确地评估ATC ASR系统的呼号识别性能?
- RQ5在偏置WFST中,何种折扣参数能实现多样化测试集上呼号识别的最佳性能?
主要发现
- 所提出的上下文感知SSL方法在liveatc_mix测试集上相比独立SSL实现了17.5%的相对CA-WER改进,将CA-WER从39.88%降低至32.9%。
- 在布拉格测试集上观察到14%的相对CA-WER改进,最优折扣参数(5.0)下,CA-WER从3.48%降至2.99%。
- 尽管部分测试集因数据质量不匹配导致WER下降,该方法在维也纳测试集上仍实现了7.5%的相对CA-WER改进,表现出良好的鲁棒性。
- 该方法在噪声和分布外测试集上显著优于独立SSL,表明其在真实世界条件下的强大泛化能力。
- 呼号词错误率(CA-WER)指标被证明比标准WER更敏感且更相关,能更准确地评估ATC ASR系统中的呼号识别性能。
- 偏置WFST的最优折扣参数被确定为5.0,该值在不引起过拟合的前提下,实现了偏置强度与序列长度之间的良好平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。