Skip to main content
QUICK REVIEW

[论文解读] Streaming Language Identification using Combination of Acoustic Representations and ASR Hypotheses

Chander Chandak, Zeynab Raeesy|arXiv (Cornell University)|Jun 1, 2020
Speech Recognition and Synthesis参考文献 5被引用 9
一句话总结

本文提出一种流式语言识别(LID)系统,结合声学嵌入与ASR 1-best假设生成的文本嵌入,相较于仅使用声学的LID,错误率相对降低高达50%。该方法可实现早期语言检测——超过一半的语音片段平均提前1500ms完成识别,同时保持高准确率,并通过使用基于文本的LID作为教师模型的半监督学习方法提升泛化能力。

ABSTRACT

This paper presents our modeling and architecture approaches for building a highly accurate low-latency language identification system to support multilingual spoken queries for voice assistants. A common approach to solve multilingual speech recognition is to run multiple monolingual ASR systems in parallel and rely on a language identification (LID) component that detects the input language. Conventionally, LID relies on acoustic only information to detect input language. We propose an approach that learns and combines acoustic level representations with embeddings estimated on ASR hypotheses resulting in up to 50% relative reduction of identification error rate, compared to a model that uses acoustic only features. Furthermore, to reduce the processing cost and latency, we exploit a streaming architecture to identify the spoken language early when the system reaches a predetermined confidence level, alleviating the need to run multiple ASR systems until the end of input query. The combined acoustic and text LID, coupled with our proposed streaming runtime architecture, results in an average of 1500ms early identification for more than 50% of utterances, with almost no degradation in accuracy. We also show improved results by adopting a semi-supervised learning (SSL) technique using the newly proposed model architecture as a teacher model.

研究动机与目标

  • 开发一种低延迟、高准确率的语言识别系统,适用于支持动态语言切换的多语言语音助手。
  • 克服仅使用声学的LID在处理带有口音的语音、语言切换以及词汇相似度高的语言对时的局限性。
  • 通过早期语言检测实现非匹配ASR系统的提前终止,从而降低计算成本。
  • 通过使用基于文本的LID作为教师模型的半监督学习方法,提升对多语言语音模式的鲁棒性。
  • 设计一种适用于流式处理的架构,能够在不牺牲延迟的前提下,定期整合ASR假设。

提出的方法

  • 系统采用双编码器架构:一个用于从原始音频帧学习声学嵌入,另两个独立编码器用于将1-best ASR假设转换为文本嵌入。
  • 最终的LID分类器通过语言分类的交叉熵损失函数,联合在声学嵌入和文本嵌入上进行训练。
  • 流式运行时策略定期向LID模块转发ASR假设(例如每600ms一次),以实现基于置信度的早期语言决策。
  • 系统采用基于时间间隔的查询策略,在固定时间间隔内评估语言置信度,从而实现非匹配ASR系统的提前终止。
  • 通过使用预训练的基于文本的LID模型对100万条匿名多语言语音流进行打标,应用半监督学习方法对仅使用声学的LID模型进行微调。
  • 教师-学生框架通过纠正标签偏差并增强对多语言及语言切换语音的表征能力,提升了仅使用声学的LID模型。

实验结果

研究问题

  • RQ1结合声学与基于文本的嵌入是否能够使语言识别准确率超越仅使用声学的模型?
  • RQ2在流式设置中,语言可多早被识别,且不牺牲准确率?提前终止ASR可带来多大的计算节省?
  • RQ3使用基于文本的LID作为教师模型的半监督学习,是否能提升仅使用声学的LID模型在多语言及语言切换语音上的泛化能力?
  • RQ4该系统在英语/印地语和英语/西班牙语等具有挑战性的语言对上的表现如何,这些语言对的声学线索具有模糊性?
  • RQ5在将ASR假设整合进LID流程时,准确率与延迟之间的权衡如何?

主要发现

  • 结合声学与文本的LID模型相较于仅使用声学的LID,错误率最高降低50%,其中英语/西班牙语对的相对降低幅度最大,达48.4%。
  • 超过50%的语音片段,平均提前1500ms完成语言识别,显著降低计算开销。
  • 在置信度阈值为0.99时,系统使英语的非目标ASR解码减少43%,西班牙语减少40%,且准确率下降可忽略。
  • 使用基于文本的LID标签进行半监督微调,显著提升了仅使用声学的LID模型,尤其在使用频率高的语言对(如英语/西班牙语和英语/印地语)中表现更优。
  • 该方法有效缓解了仅使用声学模型因长外语词或带口音语音导致的错误,以及基于文本模型因双语ASR输出导致的错误。
  • 在语言切换或混合语言语音片段中,该方法仍能保持高准确率,而传统仅使用声学的LID模型在此类情况下会失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。