Skip to main content
QUICK REVIEW

[论文解读] Open Challenge for Correcting Errors of Speech Recognition Systems

Marek Kubis, Zygmunt Vetulani|arXiv (Cornell University)|Jan 9, 2020
Advanced Data Processing Techniques被引用 5
一句话总结

本文提出了一项开放挑战,仅使用ASR假设和参考转录文本纠正自动语音识别(ASR)错误,不访问音频。参赛者利用机器学习技术开发模型以改进ASR输出,评估基于包含8,142个训练句和1,000个测试句的波兰语数据集,相关工作中最高实现19%的相对WER改进。

ABSTRACT

The paper announces the new long-term challenge for improving the performance of automatic speech recognition systems. The goal of the challenge is to investigate methods of correcting the recognition results on the basis of previously made errors by the speech processing system. The dataset prepared for the task is described and evaluation criteria are presented.

研究动机与目标

  • 开发仅利用系统错误输出和正确参考转录文本纠正自动语音识别(ASR)错误的方法。
  • 通过提供无音频访问的数据集,鼓励超越传统ASR流水线的多样化机器学习与自然语言处理方法。
  • 通过从过往错误中自我学习,提升ASR性能,实现自我演化、自动适应的系统。
  • 建立标准化评估指标(包括WER、SRR和CharMatch-F0.5)的ASR错误纠正基准。
  • 支持低资源和高噪声环境下的研究,尤其针对危机管理与虚拟助手等错误后果重大的场景。

提出的方法

  • 挑战提供来自波兰维基新闻的9,142个句子的数据集,每个句子由两名母语者朗读至ASR系统。
  • 每个数据样本包含:(1) ASR假设(错误输出),(2) 参考转录(正确版本),(3) 唯一根ID,(4) 来源标注。
  • 应用文本归一化:所有单词大写化,标点符号(连字符除外)被移除,数字和特殊字符替换为其发音形式。
  • 数据集划分为8,142个训练样本和1,000个测试样本,平均WER分别为3.94和4.01。
  • 参赛者提交仅使用假设和参考文本映射至纠正输出的系统,不使用音频或声学特征。
  • 评估通过Gonito平台进行,使用三项指标:词错误率(WER)、句子识别率(SRR)以及基于Levenshtein距离的F0.5加权CharMatch度量。

实验结果

研究问题

  • RQ1在无音频访问的前提下,机器学习模型在仅使用错误假设和正确参考的情况下,能在多大程度上纠正ASR错误?
  • RQ2在低资源或噪声环境下,多样化NLP与ML技术(尤其是序列到序列模型和SMT)在ASR错误纠正中的有效性如何?
  • RQ3从过往错误中进行自我学习是否能显著降低ASR系统的WER,特别是在危机管理等高风险应用中?
  • RQ4不同评估指标(WER、SRR、CharMatch-F0.5)与错误纠正任务在真实世界中的表现相关性如何?
  • RQ5当仅提供文本级监督时,模型架构和训练数据规模对纠正性能的影响如何?

主要发现

  • 该数据集包含来自波兰维基新闻的9,142对句子,其中8,142个用于训练,1,000个用于测试,已进行归一化处理以确保一致比较。
  • 测试集的平均WER为4.01,表明每句话的基线错误率为约4%,句子错误率为0.75。
  • 先前工作使用基于SMT的模型在2,000个样本的小型语料上实现了10.5%的相对WER改进,将WER从11.4%降低至10.2%。
  • 在4,000万条TTS生成语音上训练的LSTM序列到序列模型实现了19%的相对WER改进(基线WER:6.03%)。
  • 通过引入语言模型重打分,同一模型实现了29%的相对WER改进,证明了外部语言建模的价值。
  • CharMatch-F0.5度量旨在衡量纠正操作的精确率与召回率,其中T_i计算为假设-参考、假设-输出和输出-参考之间Levenshtein距离的平均值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。