[论文解读] Fine Grained Knowledge Transfer for Personalized Task-oriented Dialogue Systems
本文提出一种带有新颖个人控制门的个性化解码器,可在任务导向对话系统中实现用户间细粒度的、短语级别的知识迁移,同时保留个体偏好。通过将共享短语与个人短语解耦,该模型在句法级迁移基线基础上将BLEU得分提升最高达7.5%,有效缓解了个性化对话生成中的负面迁移问题。
Training a personalized dialogue system requires a lot of data, and the data collected for a single user is usually insufficient. One common practice for this problem is to share training dialogues between different users and train multiple sequence-to-sequence dialogue models together with transfer learning. However, current sequence-to-sequence transfer learning models operate on the entire sentence, which might cause negative transfer if different personal information from different users is mixed up. We propose a personalized decoder model to transfer finer granularity phrase-level knowledge between different users while keeping personal preferences of each user intact. A novel personal control gate is introduced, enabling the personalized decoder to switch between generating personalized phrases and shared phrases. The proposed personalized decoder model can be easily combined with various deep models and can be trained with reinforcement learning. Real-world experimental results demonstrate that the phrase-level personalized decoder improves the BLEU over multiple sentence-level transfer baseline models by as much as 7.5%.
研究动机与目标
- 为解决每个用户个性化对话数据不足的问题,实现用户间的有效知识迁移。
- 克服现有句法级迁移学习模型中的负面迁移问题,这些模型会将具有冲突偏好的用户之间的个人信息混合。
- 开发一种灵活、模块化的解码器,支持短语级别的知识共享,同时保留用户特定的偏好。
- 支持与各种序列到序列模型(包括seq2seq和HRED)的集成,以实现广泛适用性。
- 通过真实世界实验和案例研究,证明细粒度迁移的有效性。
提出的方法
- 提出一种带有个人控制门的个性化解码器,可动态选择从公共知识源生成共享短语,或从用户特定知识源生成个人短语。
- 控制门利用注意力机制判断某个词或短语应从共享知识源还是个性化知识源生成。
- 模型通过强化学习端到端训练,实现对话策略与响应生成的联合优化。
- 知识迁移发生在短语层面:共享短语可在用户间迁移,而个人短语为用户专属,不进行共享。
- 该架构具有模块化特性,可无缝集成至现有模型(如seq2seq和HRED),无需对架构进行大规模修改。
- 该框架支持序列到序列和层次RNN(HRED)模型,实现广泛的兼容性。
实验结果
研究问题
- RQ1与句法级迁移相比,短语级别的知识迁移是否能有效减少个性化对话系统中的负面迁移?
- RQ2所提出的个人控制门在响应生成过程中,区分共享短语与个人短语的效率如何?
- RQ3该个性化解码器在多样化用户偏好下,对响应质量的提升程度如何?
- RQ4该模型能否与seq2seq和HRED等不同基础架构有效结合?
- RQ5细粒度迁移是否在BLEU等自动评估指标上带来可测量的性能提升?
主要发现
- 所提出的短语级迁移模型PT-HRED在真实世界的咖啡订购数据集上,相较于句法级迁移基线ST-HRED,BLEU得分提升了7.5%。
- 个性化解码器在BLEU和成功率达到等多个指标上,均优于所有句法级迁移模型(ST-S2S、ST-E-S2S、ST-HRED)。
- 案例研究显示,PT-HRED能正确保留用户特定偏好(如“macchiato”而非“latte”),而ST-HRED则错误地将其他用户个人偏好迁移过来。
- 该模型在五组不同随机种子下均获得更高的BLEU得分且方差更低,表明训练稳定性得到提升。
- 个人控制门成功解耦了共享与个人短语,防止了个人敏感信息的有害传播。
- 该方法在不同基础模型(包括seq2seq和HRED)上均表现出强大泛化能力,证实了其模块化与广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。