[论文解读] Improving Spoken Language Understanding By Exploiting ASR N-best Hypotheses
本文提出将n-best ASR假设(而非仅依赖首个最佳转录)整合到语音语言理解(SLU)系统中,以提升其对自动语音识别(ASR)错误的鲁棒性。通过聚合预测结果或使用池化与直接建模等方法连接多个假设的嵌入表示,该方法在领域与意图分类任务中实现了高达25%的相对错误率降低,尤其在ASR首个最佳结果错误时效果更显著。
In a modern spoken language understanding (SLU) system, the natural language understanding (NLU) module takes interpretations of a speech from the automatic speech recognition (ASR) module as the input. The NLU module usually uses the first best interpretation of a given speech in downstream tasks such as domain and intent classification. However, the ASR module might misrecognize some speeches and the first best interpretation could be erroneous and noisy. Solely relying on the first best interpretation could make the performance of downstream tasks non-optimal. To address this issue, we introduce a series of simple yet efficient models for improving the understanding of semantics of the input speeches by collectively exploiting the n-best speech interpretations from the ASR module.
研究动机与目标
- 解决仅依赖ASR首个最佳假设的SLU系统所存在的局限性,因为该假设可能因识别错误而产生偏差。
- 通过利用n-best列表中的多个假设,提升在存在ASR错误时的语音语言理解鲁棒性。
- 开发并评估在训练与推理阶段对n-best ASR输出进行实用化整合的方法,以提升下游自然语言理解性能。
- 证明使用多个假设可带来一致的性能提升,尤其在首个最佳ASR输出错误时更为显著。
- 为未来基于置信度分数、词级别特征以及结构化表示(如词图)的高级整合技术研究奠定基础。
提出的方法
- 使用n-best ASR假设(n=5)作为NLU模型的输入,而非仅首个最佳转录结果。
- 通过池化(如平均池化或最大池化)对BiLSTM编码器生成的假设嵌入进行特征级整合。
- 通过在分类头前拼接多个假设的文本或其嵌入表示,实现直接建模。
- 在训练阶段使用n-best假设进行模型训练,以提升泛化能力,即使真实转录不在n-best列表中亦可。
- 在重排序与整合策略中引入置信度分数和排名位置作为辅助特征。
- 通过基线模型(仅使用首个最佳结果)、最优模型(真实转录)以及多种整合策略,在领域与意图分类任务中评估模型性能。
实验结果
研究问题
- RQ1与仅依赖首个最佳假设相比,整合多个n-best ASR假设是否能提升语音语言理解的准确性?
- RQ2当ASR首个最佳假设正确或错误时,SLU模型的性能表现有何差异?
- RQ3在池化、拼接或直接建模这三种整合策略中,哪一种能带来最鲁棒且最有效的NLU任务性能提升?
- RQ4使用的n-best假设数量如何影响最终分类性能?
- RQ5在真实转录不在n-best列表中的情况下,基于n-best假设训练的模型是否能更好地泛化到未见数据?
主要发现
- 所提出的n-best ASR假设整合方法在领域分类任务中实现了25%的相对错误率降低,其中表现最佳的方法(PoolingAvg)在首个最佳假设与真实转录不一致的子集中实现了24.67%的相对错误率降低。
- 在首个最佳假设与真实转录一致的子集中,整合模型仍能提升性能,PoolingAvg实现了3.56%的相对错误率降低,表明即使首个最佳结果正确,该方法也具备鲁棒性。
- 通过置信度分数对假设进行排序的Direct模型在不一致子集中实现了9.95%的相对错误率降低,优于多数投票(7.59%)和使用最优模型重排序(7.25%)。
- 随着使用假设数量的增加,性能持续提升,但当使用超过四个假设后,性能增益趋于平缓,表明n=4后收益递减。
- PoolingAvg方法在所测试的全部8个主要领域中均一致提升了准确率,展现出广泛的适用性与鲁棒性。
- 在意图分类任务中,PoolingAvg在购物领域实现了25.55%的相对错误率降低,在知识领域为25.00%,在通信领域为11.92%,显著优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。