[论文解读] MinTL: Minimalist Transfer Learning for Task-Oriented Dialogue Systems
本文提出 MinTL,一种极简的迁移学习框架,通过使用 T5 和 BART 等预训练序列到序列模型,联合学习对话状态追踪(DST)与响应生成。通过引入莱文施泰因信念跨度(Lev),MinTL 减少了生成长度和推理延迟,在仅使用 20% 训练数据的情况下,于 MultiWOZ 上实现了最先进性能,且推理速度比之前的方法快 15 倍。
In this paper, we propose Minimalist Transfer Learning (MinTL) to simplify the system design process of task-oriented dialogue systems and alleviate the over-dependency on annotated data. MinTL is a simple yet effective transfer learning framework, which allows us to plug-and-play pre-trained seq2seq models, and jointly learn dialogue state tracking and dialogue response generation. Unlike previous approaches, which use a copy mechanism to "carryover" the old dialogue states to the new one, we introduce Levenshtein belief spans (Lev), that allows efficient dialogue state tracking with a minimal generation length. We instantiate our learning framework with two pre-trained backbones: T5 and BART, and evaluate them on MultiWOZ. Extensive experiments demonstrate that: 1) our systems establish new state-of-the-art results on end-to-end response generation, 2) MinTL-based systems are more robust than baseline methods in the low resource setting, and they achieve competitive results with only 20\% training data, and 3) Lev greatly improves the inference efficiency.
研究动机与目标
- 通过消除特定任务模块,简化任务导向对话系统的设计。
- 通过有效的迁移学习,减少对大规模标注对话数据的依赖。
- 在不牺牲性能的前提下,提升对话状态追踪的推理效率。
- 使用预训练序列到序列模型,实现对话状态追踪与响应生成的端到端联合学习。
- 在仅使用极少训练数据的低资源设置下,展示模型的鲁棒性。
提出的方法
- MinTL 采用即插即用的架构,集成预训练序列到序列模型(T5 和 BART),实现对话状态追踪与响应生成的联合学习。
- 它引入了莱文施泰因信念跨度(Lev),仅对旧状态与新状态之间的差异进行建模,从而最小化生成长度。
- 该框架首先生成 Lev 标记以更新对话状态,然后利用更新后的状态检索知识并生成响应。
- 响应解码器同时基于对话上下文和检索到的知识进行条件生成,以生成自然且上下文准确的响应。
- Lev 使得状态更新仅需生成极少数标记,显著降低推理延迟。
- 该方法兼容多种预训练主干网络,且无需使用特定任务的模块,如复制机制或分类器。
实验结果
研究问题
- RQ1是否能够通过极简的迁移学习框架,在无需特定任务模块的情况下,联合优化对话状态追踪与响应生成?
- RQ2莱文施泰因信念跨度(Lev)机制如何提升对话状态追踪中的推理效率?
- RQ3在仅使用 20% 训练数据的低资源设置下,MinTL 能在多大程度上保持高性能?
- RQ4在联合目标准确率和推理速度方面,MinTL 与最先进模型相比表现如何?
- RQ5像 T5 和 BART 这类预训练序列到序列模型,是否能够通过极少的架构修改,有效适配端到端任务导向对话?
主要发现
- 使用 BART-large 的 MinTL 在 MultiWOZ 2.1 上实现了 53.62% 的联合目标准确率,为基于生成的对话状态追踪设定了新的最先进水平。
- 在 MultiWOZ 2.0 上,MinTL(T5-base)实现了 52.07% 的联合目标准确率,优于之前的最先进模型。
- 仅使用 20% 的训练数据,MinTL 系统即达到具有竞争力的性能,展现出在低资源设置下的强大鲁棒性。
- MinTL(T5-small)将每轮推理延迟降低至 49.26ms,相比 Sequicity 实现了 15.58 倍的加速,相比 TRADE 实现了 2.12 倍的加速。
- Lev 机制将每轮平均生成标记数减少至 6.58 个,与之前方法相比显著提升了推理效率。
- MinTL 在准确率和速度上均优于非生成模型如 SST 和 TRADE,证明了通过极少生成实现端到端学习的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。