[论文解读] Curriculum-based transfer learning for an effective end-to-end spoken language understanding and domain portability
本论文提出了一种端到端的SLU模型,使用基于课程的迁移学习进行训练,直接从语音中提取语义概念,在法国 MEDIA/PORTMEDIA 上达到状态-of-the-art,并解决领域可迁移性的问题。
We present an end-to-end approach to extract semantic concepts directly from the speech audio signal. To overcome the lack of data available for this spoken language understanding approach, we investigate the use of a transfer learning strategy based on the principles of curriculum learning. This approach allows us to exploit out-of-domain data that can help to prepare a fully neural architecture. Experiments are carried out on the French MEDIA and PORTMEDIA corpora and show that this end-to-end SLU approach reaches the best results ever published on this task. We compare our approach to a classical pipeline approach that uses ASR, POS tagging, lemmatizer, chunker... and other NLP tools that aim to enrich ASR outputs that feed an SLU text to concepts system. Last, we explore the promising capacity of our end-to-end SLU approach to address the problem of domain portability.
研究动机与目标
- 利用基于课程的迁移学习在更简单、相关的任务上进行预训练,以解决标注的端到端SLU数据不足的问题。
- 开发一种端到端的神经SLU架构,直接将语音映射到语义概念及其取值。
- 评估从MEDIA域到PORTMEDIA域的迁移,以研究领域可迁移性。
- 将端到端方法与经典流水线SLU系统进行比较,并评估 starred 模式在语义提取方面的优势。
提出的方法
- 采用受 Deep Speech 2 启发的端到端神经SLU架构,使用声谱图输入和CTC损失来预测词语和语义标签。
- 用每个概念的专用起始标签和一个结束标签来表示语义槽,便于提取概念/取值。
- 引入 star 模式,在训练时将概念标签之间的文本替换为一个星号,以突出语义区域。
- 通过对训练数据进行排序,先用通用的ASR/转写数据,再到命名实体注释,最后到联合的 MEDIA/PORTMEDIA 概念,应用基于课程的迁移学习,在每一步仅重新初始化输出层。
- 使用束搜索解码和5-gram语言模型重评分进行微调,以提高CER/CVER。
实验结果
研究问题
- RQ1经过课程化迁移学习训练的端到端SLU模型是否能在法语SLU任务上超越传统流水线方法?
- RQ2在课程中整合MEDIA和PORTMEDIA数据是否能改善槽填充性能并实现领域可迁移性?
- RQ3starred 模式和LM重评分对端到端SLU性能有何影响?
- RQ4所提方法在跨相关域(MEDIA到PORTMEDIA)转移SLU模型方面有多有效?
主要发现
- 端到端SLU结合基于课程的迁移学习,在仅在MEDIA数据上进行训练时相比,取得显著的CER/CVER降幅(例如仅使用SF_M时为39.8% CER和52.1% CVER,而使用完整课程在MEDIA上为21.6% CER和27.7% CVER)。
- 先在ASR上进行预训练再迁移到MEDIA(ASR•SF_M)使CER降至23.7%且CVER降至30.3%。
- 合并MEDIA+PORTMEDIA的课程串联(ASR•SF_P+M•SF_M)进一步将CER降至22.2%且CVER降至28.8%。
- 在各步骤之间包含NER的完整课程在贪婪模式下在MEDIA上达到21.6% CER和27.7% CVER;使用LM进行束重评分进一步提高到18.1% CER和22.1% CVER(在后续步骤的STARred模式下,在某些配置中达到16.4% CER和20.9% CVER)。
- 与流水线CRF系统相比,端到端方法配合强ASR可以实现具有竞争力的CER/CVER(例如具有全部特征的流水线为16.1% CER和20.4% CVER),差异在95%置信区间内没有统计学显著性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。