Skip to main content
QUICK REVIEW

[论文解读] Automatic Speech Recognition Benchmark for Air-Traffic Communications

Juan Zuluaga-Gómez, Petr Motlíček|arXiv (Cornell University)|Jun 18, 2020
Speech Recognition and Synthesis参考文献 28被引用 5
一句话总结

本论文基于来自六个数据库的超过170小时的领域内ATC语音数据,提出了一项面向航空交通管制通信的最先进自动语音识别(ASR)基准。结果表明,采用多样化口音进行训练并使用字节对编码(BPE)可显著降低词错误率(WER),在布拉格数据集上实现5.0%的WER,在四个测试集上平均WER为7.75%,其中在某一数据集上使用BPE实现35%的相对性能提升。

ABSTRACT

Advances in Automatic Speech Recognition (ASR) over the last decade opened new areas of speech-based automation such as in Air-Traffic Control (ATC) environment. Currently, voice communication and data links communications are the only way of contact between pilots and Air-Traffic Controllers (ATCo), where the former is the most widely used and the latter is a non-spoken method mandatory for oceanic messages and limited for some domestic issues. ASR systems on ATCo environments inherit increasing complexity due to accents from non-English speakers, cockpit noise, speaker-dependent biases, and small in-domain ATC databases for training. Hereby, we introduce CleanSky EC-H2020 ATCO2, a project that aims to develop an ASR-based platform to collect, organize and automatically pre-process ATCo speech-data from air space. This paper conveys an exploratory benchmark of several state-of-the-art ASR models trained on more than 170 hours of ATCo speech-data. We demonstrate that the cross-accent flaws due to speakers' accents are minimized due to the amount of data, making the system feasible for ATC environments. The developed ASR system achieves an averaged word error rate (WER) of 7.75% across four databases. An additional 35% relative improvement in WER is achieved on one test set when training a TDNNF system with byte-pair encoding.

研究动机与目标

  • 解决当前缺乏大规模、已转录的ATC语音数据库以训练鲁棒ASR系统的关键问题。
  • 评估最先进的深度神经网络(DNN)架构及训练策略在ATC通信中实现低词错误率性能的潜力。
  • 研究跨口音训练与子词分词(BPE)对处理未登录词(OOV)及口音差异的影响。
  • 在包含多样化口音与术语表达的多个测试集上,建立ATC ASR的新性能基线。

提出的方法

  • 在来自六个不同数据库的超过170小时的领域内ATC语音数据上,训练了多种DNN架构,包括TDNNF、CNN+TDNNF以及基于BPE的模型。
  • 通过在域外(OOD)语料上进行预训练,随后在领域内ATC数据上微调,应用迁移学习以提升泛化能力。
  • 采用无格架最大互信息(LF-MMI)训练方法进行端到端声学建模,以优化WER。
  • 使用字节对编码(BPE)表示未登录词,提升对非母语口音和罕见术语的鲁棒性。
  • 通过组合多个训练集(Tr1+Tr2)增加数据多样性,降低WER,尤其对非英语口音效果显著。
  • 使用n-gram语言模型(4-gram与6-gram)及基于词典的BPE方法,提升解码准确性。

实验结果

研究问题

  • RQ1与单一口音基线相比,基于多样化跨口音ATC语音数据进行训练是否能显著降低WER?
  • RQ2从域外(OOD)语料迁移学习在有限的领域内ATC数据上,能在多大程度上提升ASR性能?
  • RQ3在ATC通信中,子词分词(BPE)与词级别分词相比,如何更有效地处理未登录词和非母语口音?
  • RQ4在具有不同口音的多个ATC测试集上,模型架构(如TDNNF与CNN+TDNNF)对WER的影响如何?
  • RQ5混合框架如Pkwrap是否能进一步提升ATC应用中的ASR性能?

主要发现

  • 所提出的ASR系统在包含多样化口音的四个测试集上实现了7.75%的平均词错误率(WER),展现出强大的泛化能力。
  • 与先前工作相比,使用组合训练集(Tr1+Tr2)使维也纳和布拉格数据集的WER分别相对降低了29.8%和37.9%。
  • CNN+TDNNF模型在布拉格数据集上实现了5.0% WER的新基线,相比TDNNF基线相对提升了3.8%。
  • 与基于词的模型相比,字节对编码(BPE)将删除错误减少了五倍,主要归因于对未登录词(尤其是非英语术语)的更好处理。
  • 在维也纳数据集上,从域外预训练模型微调的迁移学习带来了10%的相对WER性能提升。
  • 基于BPE的模型在处理外语术语方面优于基于词的模型,归因于词典设计中更好的字符级泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。