[论文解读] A Financial Service Chatbot based on Deep Bidirectional Transformers
本文提出 AVA,一个基于微调 BERT 模型构建的任务导向型金融客服聊天机器人,可高精度地对 381 种意图进行分类。该工作引入了基于蒙特卡洛 dropout 和基于熵的阈值的新型不确定性量化方法,以提升溢出查询的升级决策能力,并利用 BERT 的掩码语言建模功能实现自动拼写纠正,从而增强在噪声输入下的意图分类鲁棒性。
We develop a chatbot using Deep Bidirectional Transformer models (BERT) to handle client questions in financial investment customer service. The bot can recognize 381 intents, and decides when to say "I don't know" and escalates irrelevant/uncertain questions to human operators. Our main novel contribution is the discussion about uncertainty measure for BERT, where three different approaches are systematically compared on real problems. We investigated two uncertainty metrics, information entropy and variance of dropout sampling in BERT, followed by mixed-integer programming to optimize decision thresholds. Another novel contribution is the usage of BERT as a language model in automatic spelling correction. Inputs with accidental spelling errors can significantly decrease intent classification performance. The proposed approach combines probabilities from masked language model and word edit distances to find the best corrections for misspelled words. The chatbot and the entire conversational AI system are developed using open-source tools, and deployed within our company's intranet. The proposed approach can be useful for industries seeking similar in-house solutions in their specific business domains. We share all our code and a sample chatbot built on a public dataset on Github.
研究动机与目标
- 开发一个可靠、内部部署的任务导向型聊天机器人,用于金融客户服务,以减少通话处理时间和对专家的依赖。
- 通过基于不确定性的决策机制,解决处理超出范围或模糊查询的挑战,实现向人工客服的准确升级。
- 通过集成基于 BERT 的自动拼写纠正,提升在真实世界噪声输入下的意图分类鲁棒性。
- 通过知识蒸馏和 BERT 模型架构剪枝,在不显著损失准确率的前提下优化推理效率。
- 提供一个可直接投入生产的、开源可部署的对话式 AI 系统,使用现成工具和模型。
提出的方法
- 在领域特定的训练数据上对 BERT-base 进行微调,用于对 381 种金融业务意图进行分类。
- 在推理阶段应用蒙特卡洛 dropout(MCD),通过多次使用不同 dropout 掩码的前向传播来估计预测不确定性。
- 评估了两种不确定性度量指标——信息熵和 MCD 预测的方差——以判断模型对预测结果的置信度。
- 采用混合整数规划方法,优化决策阈值,以区分高置信度预测、不确定性预测以及超出范围的查询。
- 将 BERT 的掩码语言模型与词编辑距离(如 Levenshtein 距离)结合,用于在意图分类前识别并纠正拼写错误的输入词元。
- 使用开源工具(Rasa、PyTorch、TensorFlow)进行系统部署,通过 AWS SageMaker 托管 RESTful API,并通过 Bot Framework 集成至 Microsoft Teams。
实验结果
研究问题
- RQ1如何有效量化基于 BERT 的意图分类中的不确定性,并将其用于提升生产环境中聊天机器人的升级决策能力?
- RQ2在真实世界的金融 NLP 任务中,基于 dropout 采样信息熵与方差作为不确定性度量指标的相对性能如何?
- RQ3BERT 的预训练语言建模能力能否被有效重用于自动拼写纠正,以提升意图分类的鲁棒性?
- RQ4在最小化准确率损失的前提下,BERT 模型压缩(减少注意力头和隐藏层)能在多大程度上提升推理吞吐量并降低延迟?
- RQ5结合不确定性感知分类与拼写纠正的混合方法,如何增强封闭领域金融聊天机器人的可靠性?
主要发现
- 结合基于熵的不确定性阈值的蒙特卡洛 dropout 方法显著提升了机器人检测并升级超出范围查询的能力,减少了错误响应。
- 在完整的 BERT-Small 架构(12 个注意力头,12 个隐藏层)上,模型实现了 94.4% 的意图分类准确率;当缩减为 6 个注意力头和 6 个隐藏层时,准确率仅下降 1.6%。
- 最小优化模型(6A-6H)的吞吐量达到原始 BERT-Small 的两倍(18.1 个请求/秒),延迟降低至一半(552 毫秒),且性能仅下降 1.6%。
- 拼写纠正模块通过结合 BERT 掩码语言模型概率与编辑距离,有效减少了用户输入中拼写错误导致的意图分类错误。
- 混合整数规划成功应用于确定不确定性升级的最优决策阈值,在超出范围检测中实现了精确率与召回率的平衡。
- 整个系统已成功作为内部解决方案部署,使用开源工具,展示了其在企业级金融聊天机器人中的可行性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。