[论文解读] Integration of Pre-trained Networks with Continuous Token Interface for End-to-End Spoken Language Understanding
本文提出连续标记接口(CTI),一种新颖方法,通过利用共享词汇表和连续概率分布,端到端地整合预训练的自动语音识别(ASR)与自然语言理解(NLU)网络,实现对ASR输出的直接、可微融合,无需额外模块(如Gumbel-Softmax),在SLURP数据集上取得最先进性能:意图分类准确率为82.93%,SLU-F1为71.12%;使用合成数据后进一步提升至86.92%和74.66%。
Most End-to-End (E2E) SLU networks leverage the pre-trained ASR networks but still lack the capability to understand the semantics of utterances, crucial for the SLU task. To solve this, recently proposed studies use pre-trained NLU networks. However, it is not trivial to fully utilize both pre-trained networks; many solutions were proposed, such as Knowledge Distillation, cross-modal shared embedding, and network integration with Interface. We propose a simple and robust integration method for the E2E SLU network with novel Interface, Continuous Token Interface (CTI), the junctional representation of the ASR and NLU networks when both networks are pre-trained with the same vocabulary. Because the only difference is the noise level, we directly feed the ASR network's output to the NLU network. Thus, we can train our SLU network in an E2E manner without additional modules, such as Gumbel-Softmax. We evaluate our model using SLURP, a challenging SLU dataset and achieve state-of-the-art scores on both intent classification and slot filling tasks. We also verify the NLU network, pre-trained with Masked Language Model, can utilize a noisy textual representation of CTI. Moreover, we show our model can be trained with multi-task learning from heterogeneous data even after integration with CTI.
研究动机与目标
- 解决仅依赖预训练ASR模型的端到端语音语言理解(E2E SLU)系统中存在的语义理解差距问题。
- 克服现有集成方法(如知识蒸馏、共享嵌入或离散接口)的局限性——这些方法或会损害预训练表征,或需要复杂模块。
- 通过一种新型接口实现预训练ASR与NLU网络的直接、可微融合,最大限度减少表征差距。
- 在具有挑战性的SLURP基准上,实现意图分类与槽位填充的最先进性能。
提出的方法
- 提出连续标记接口(CTI),一种源自ASR与NLU网络在相同词汇表上联合预训练的连接表征,支持ASR输出直接传递至NLU模型。
- 将ASR网络的softmax概率分布作为NLU模型的噪声文本表示,将其视为连续、可微输入。
- 通过共享词汇表确保最小表征差距,从而消除对离散分词或可微松弛技术(如Gumbel-Softmax)的需求。
- 采用多任务损失端到端训练完整E2E SLU模型:包括ASR损失、SLU损失(意图与槽位)以及NLU预训练损失。
- 支持NLU模型在仅文本数据上独立预训练,从而保留其语言能力。
- 利用SLURP-Synth数据——合成语音配对文本与标签——进一步提升模型鲁棒性与性能。

实验结果
研究问题
- RQ1能否设计一种连续、可微接口,在无需额外模块(如Gumbel-Softmax)的情况下,实现预训练ASR与NLU网络的集成?
- RQ2当输入为噪声ASR输出时,所提出的CTI接口是否能有效保留预训练NLU模型的语义能力?
- RQ3与知识蒸馏、共享嵌入或离散接口等现有方法相比,CTI在性能与训练稳定性方面表现如何?
- RQ4将仅文本的预训练与语音数据结合,是否能提升低资源SLU任务中的泛化能力与性能?
- RQ5使用合成数据(SLURP-Synth)在多大程度上提升了E2E SLU模型的鲁棒性与准确性?
主要发现
- 基于CTI的端到端SLU模型在SLURP数据集上实现最先进意图分类准确率82.93%与SLU-F1得分71.12%。
- 引入NLU预训练损失(L_NLU)后,意图分类准确率提升0.54个百分点,SLU-F1提升0.51个百分点,证实CTI有效保留了NLU模型的预训练语言能力。
- 仅通过文本微调使用SLURP-Synth数据,相比基线模型,意图准确率提升2.5个百分点。
- 在SLURP-Synth数据上端到端训练完整模型(包含语音、文本与标签),进一步将意图准确率提升至86.92%,SLU-F1提升至74.66%,创下新SOTA纪录。
- 在相同条件下,CTI接口相比基于Gumbel-Softmax的接口,在意图分类上高出0.83个百分点,在SLU-F1上高出0.57个百分点。
- 消融实验表明,NLU模型能有效利用通过CTI输入的噪声连续ASR输出,验证了接口设计的鲁棒性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。