[论文解读] Teacher-Student Framework Enhanced Multi-domain Dialogue Generation
本文提出了一种教师-学生框架,用于多领域对话生成,通过将领域特定教师模型的知识蒸馏到通用学生模型中,消除了对外部状态追踪器的需求。学生模型直接从原始文本生成回复,通过蒸馏利用标注的语义数据,避免了追踪器错误传播,从而在成功率和信息传递率方面达到更优表现——与使用人工状态标注的模型相当或更优。
Dialogue systems dealing with multi-domain tasks are highly required. How to record the state remains a key problem in a task-oriented dialogue system. Normally we use human-defined features as dialogue states and apply a state tracker to extract these features. However, the performance of such a system is limited by the error propagation of a state tracker. In this paper, we propose a dialogue generation model that needs no external state trackers and still benefits from human-labeled semantic data. By using a teacher-student framework, several teacher models are firstly trained in their individual domains, learn dialogue policies from labeled states. And then the learned knowledge and experience are merged and transferred to a universal student model, which takes raw utterance as its input. Experiments show that the dialogue system trained under our framework outperforms the one uses a belief tracker.
研究动机与目标
- 解决多领域任务导向对话系统中状态追踪器的局限性,后者在复杂、高本体场景下易受错误传播影响且性能下降。
- 实现仅以原始文本作为输入的端到端对话生成,同时在训练过程中受益于人工标注的语义数据。
- 开发一个通用学生模型,从多个领域特定教师模型中学习并泛化对话策略,而无需依赖外部信念追踪。
- 通过将教师模型的结构化知识迁移至统一的学生架构,提升多领域场景下的对话成功率和信息传递率。
提出的方法
- 在标注的对话数据上训练多个领域特定的教师模型,以从人工标注的状态中学习对话策略和语义表示。
- 使用知识蒸馏将教师模型的输出分布和策略决策转移至单一通用学生模型。
- 采用两阶段蒸馏:输出蒸馏(回复生成)和策略蒸馏(动作/决策引导),并结合 top-k 令牌选择以保留关键信息。
- 通过加权损失函数优化学生模型,结合输出蒸馏(α₁ = 0.01)和策略蒸馏(α₂ = 0.05),以平衡回复质量和对话策略准确性。
- 在原始话语上端到端训练学生模型,无需显式信念状态追踪或人工定义的槽位表示。
- 使用 MultiWOZ 基准进行评估,测量多领域和单领域设置下的成功率、信息传递率以及 BLEU-4 分数。
实验结果
研究问题
- RQ1多教师单学生框架能否在无需外部状态追踪的情况下,有效将领域特定对话知识迁移至通用学生模型?
- RQ2与仅使用一种蒸馏形式相比,同时蒸馏回复输出和对话策略决策是否能提升对话成功率和信息传递率?
- RQ3top-k 蒸馏的选择如何影响学生模型在成功率和信息传递率方面的性能?
- RQ4在无人工定义状态的情况下训练的学生模型,是否能在多领域对话生成中超越使用外部信念追踪器的模型?
- RQ5在特定领域(如餐厅预订)中,个体领域特定教学在多大程度上提升了性能?
主要发现
- 所提出的 HRED-TS 模型在无需蒸馏的基线 HRED 模型基础上,成功率和信息传递率均提升了 4%,且优于使用外部信念追踪器的模型。
- 在餐厅领域,HRED-TS 模型甚至超越了使用人工状态输入的模型,表明来自专用教师的强领域特定知识迁移能力。
- top-k 蒸馏中 k=128 时性能最佳,而 k=1 出现异常结果,表明过度严格的蒸馏限制了知识迁移。
- 仅输出蒸馏可获得最高信息传递率,而结合策略与输出蒸馏虽提升成功率但略微降低信息传递率,表明策略引导存在权衡。
- 使用单一通用教师模型进行蒸馏的表现劣于使用各领域特定教师模型,证实了在教师-学生框架中领域特定知识的优势。
- 使用 GCE 状态追踪器的模型信息传递率高于人工状态输入,但此现象归因于标注中的领域干扰,而非性能优越。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。