Skip to main content
QUICK REVIEW

[论文解读] How Does Pre-trained Wav2Vec 2.0 Perform on Domain Shifted ASR? An Extensive Benchmark on Air Traffic Control Communications

Juan Zuluaga-Gómez, Amrutha Prasad|arXiv (Cornell University)|Mar 31, 2022
Speech Recognition and Synthesis被引用 5
一句话总结

本研究评估了预训练 Wav2Vec 2.0 和 XLS-R 模型在航空交通管制(ATC)通信自动语音识别(ASR)任务中的鲁棒性,该领域与标准 ASR 数据集存在显著的声学与语言学差异。在仅使用 5 分钟领域内数据进行微调的情况下,相对 WER 降低 20–40%,性能超越使用 8 小时数据的传统系统,同时揭示了对女性语音的系统性偏好偏差。

ABSTRACT

Recent work on self-supervised pre-training focus on leveraging large-scale unlabeled speech data to build robust end-to-end (E2E) acoustic models (AM) that can be later fine-tuned on downstream tasks e.g., automatic speech recognition (ASR). Yet, few works investigated the impact on performance when the data properties substantially differ between the pre-training and fine-tuning phases, termed domain shift. We target this scenario by analyzing the robustness of Wav2Vec 2.0 and XLS-R models on downstream ASR for a completely unseen domain, air traffic control (ATC) communications. We benchmark these two models on several open-source and challenging ATC databases with signal-to-noise ratio between 5 and 20 dB. Relative word error rate (WER) reductions between 20% to 40% are obtained in comparison to hybrid-based ASR baselines by only fine-tuning E2E acoustic models with a smaller fraction of labeled data. We analyze WERs on the low-resource scenario and gender bias carried by one ATC dataset.

研究动机与目标

  • 评估自监督 Wav2Vec 2.0 和 XLS-R 模型在完全未见过的领域——航空交通管制(ATC)通信——中的鲁棒性。
  • 确定微调至与基于混合模型的 ASR 系统性能相当所需的最少领域内标注数据量。
  • 调查在 ATC 语音上进行微调时,性别差异对 ASR 性能的影响,特别是针对男性与女性说话人。
  • 建立开源基线与可复现的实验设置,基于公开的 ATC 语料库,以促进该未充分探索领域的研究。

提出的方法

  • 在多个开源 ATC 语音数据集上微调 Wav2Vec 2.0 和 XLS-R 模型,其信噪比范围为 5–20 dB。
  • 开展低资源微调实验,数据量从 5 分钟到 15 小时不等,以评估数据效率。
  • 同时使用贪婪解码与束搜索策略,并结合领域内语言模型,评估解码策略对 WER 的影响。
  • 将端到端(E2E)模型与基于混合模型的 ASR 基线进行对比,量化性能提升。
  • 分析在 ATCO2-Test 和 ATCOSIM 数据集上性别相关的性能表现,评估不同微调数据规模下的 WER 差异。
  • 在 GitHub 上公开代码与基线模型,以确保可复现性,并推动 ATC ASR 领域的开放科学。

实验结果

研究问题

  • RQ1当应用于与预训练数据存在显著领域差异的航空交通管制通信时,预训练的 Wav2Vec 2.0 和 XLS-R 模型表现出多强的鲁棒性?
  • RQ2为使端到端(E2E)模型性能达到与基于混合模型的 ASR 系统相当的水平,所需的最少领域内 ATC 语音数据量是多少?
  • RQ3ATC 语音中的性别差异如何影响预训练 E2E ASR 模型的性能?是否存在可测量的识别准确率性别偏差?
  • RQ4在低资源 ATC ASR 场景下,集成领域内语言模型在多大程度上能改善 WER?
  • RQ5由于具有抗口音的表征能力,多语言 XLS-R 模型是否能在多口音 ATC 数据上优于单语 Wav2Vec 2.0 模型?

主要发现

  • 仅使用 5 分钟领域内 ATC 数据微调 Wav2Vec 2.0 模型,在 ISAVIA 和 NATS 测试集上的 WER 分别达到 40% 和 43.9%,展现出极高的数据效率。
  • 当使用 8 小时微调数据时,Wav2Vec 2.0 在 ISAVIA 和 NATS 上的 WER 均低于 10%,超越了基于混合模型的 ASR 基线。
  • 与基于混合模型的基线相比,即使在有限的领域内数据条件下,ISAVIA 和 NATS 上的相对 WER 降低了 20–40%。
  • 在 UWB-ATCC 数据上训练的模型在 LDC-ATCC 上达到 54% WER,而反向设置则达到 64% WER,表明存在强烈的领域特异性适应效应。
  • 女性语音录音的性能始终优于男性语音录音,当微调数据从 1 小时增至 3.5 小时时,女性语音的 WER 降低 29.79%,而男性语音仅降低 21.74%。
  • 结果表明,Wav2Vec 2.0 模型可能存在细微的性别偏差,可能源于预训练数据的不平衡,通过引入更多代表性不足性别的数据可缓解该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。