[论文解读] A comprehensive solution to retrieval-based chatbot construction
本文提出了一种端到端框架,利用自监督对比学习、带有缓存话语嵌入的层次化RNN架构,以及一种系统化生成预设回复和弱标签数据集的方法,从无标注聊天记录中构建基于检索的聊天机器人。自监督对比学习模型优于二分类和多分类基线模型,表明大规模自监督可以消除真实部署中对昂贵人工标注的需求。
In this paper we present the results of our experiments in training and deploying a self-supervised retrieval-based chatbot trained with contrastive learning for assisting customer support agents. In contrast to most existing research papers in this area where the focus is on solving just one component of a deployable chatbot, we present an end-to-end set of solutions to take the reader from an unlabelled chatlogs to a deployed chatbot. This set of solutions includes creating a self-supervised dataset and a weakly labelled dataset from chatlogs, as well as a systematic approach to selecting a fixed list of canned responses. We present a hierarchical-based RNN architecture for the response selection model, chosen for its ability to cache intermediate utterance embeddings, which helped to meet deployment inference speed requirements. We compare the performance of this architecture across 3 different learning objectives: self-supervised contrastive learning, binary classification, and multi-class classification. We find that using a self-supervised contrastive learning model outperforms training the binary and multi-class classification models on a weakly labelled dataset. Our results validate that the self-supervised contrastive learning approach can be effectively used for a real-world chatbot scenario.
研究动机与目标
- 开发一种可部署的、基于检索的聊天机器人,用于客服人员,且无需完全标注的数据集。
- 解决从非结构化聊天记录中通过基于嵌入的聚类和专家优化构建高质量预设回复列表的挑战。
- 创建一种可扩展的自监督训练流程,通过在原始聊天记录上应用对比学习避免人工标注。
- 通过带有缓存话语嵌入的层次化RNN架构优化模型推理速度,以实现CPU部署。
- 在真实客户支持场景中,将自监督对比学习与监督基线(二分类和多分类分类)进行比较。
提出的方法
- 通过将客服回复视为正样本,随机采样的话语作为负样本,构建自监督数据集,并使用skip-thought嵌入进行负样本采样。
- 构建一种带有缓存中间话语嵌入的层次化RNN架构,以加速CPU上的推理。
- 通过在客服回复与预设回复之间使用精确匹配(正则表达式)和模糊匹配(基于嵌入)的方法,生成弱标签数据集。
- 使用相同的预设回复列表和数据集划分,训练三种响应选择模型:对比学习、二分类和多分类分类。
- 应用置信度阈值机制,以决定何时建议使用预设回复,从而最小化不恰当建议的发生。
- 通过利用缓存嵌入和高效的相似度计算,优化模型服务管道,以满足实时推理需求。
实验结果
研究问题
- RQ1自监督对比学习是否能有效训练响应检索模型,而无需任何人工标注的标签?
- RQ2在真实聊天记录数据集上,自监督对比学习模型的性能与监督基线(二分类和多分类分类)相比如何?
- RQ3在层次化RNN架构中缓存话语嵌入在多大程度上提升了CPU部署的推理速度?
- RQ4不同的负样本采样策略在性能上如何影响模型表现,特别是对置信度和召回率的影响?
- RQ5在添加新的预设回复时,训练时间、推理速度和可扩展性之间的实际权衡是什么?
主要发现
- 在内部聊天记录数据集上,自监督对比学习模型在响应选择准确率和top-1召回率方面均优于二分类和多分类分类模型。
- 多分类分类模型表现出最高的预测置信度,使得设置可靠的响应建议阈值更加容易。
- 带有缓存嵌入的层次化RNN架构实现了足够的推理速度,可满足实时CPU部署需求,其延迟表现优于更复杂的注意力模型。
- 随机负样本采样在二分类和对比学习模型中均导致次优性能,表明负样本采样质量对嵌入空间质量有显著影响。
- 自监督方法使得无需重新训练即可轻松扩展预设回复列表,而监督基线在列表更新后需要重新训练。
- 尽管不完美,弱标签数据集仍能有效训练监督模型,并验证了从原始聊天记录中自动生成标签的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。