[论文解读] Replicated Siamese LSTM in Ticketing System for Similarity Learning and Retrieval in Asymmetric Texts
本文提出一种复制型孪生LSTM架构,以提升工业工单系统中非对称文本对(短查询(主题、描述)与较长的历史工单(主题、描述、解决方案))的语义相似度学习与检索性能。通过利用多层次(主题、描述、解决方案)和多通道(分布式词嵌入、LSTM、主题向量)表示,该模型在无监督基线上实现了Accuracy@10 22%的提升,在有监督基线上实现了7%的提升,显著改善了真实世界中的相似度检索任务。
The goal of our industrial ticketing system is to retrieve a relevant solution for an input query, by matching with historical tickets stored in knowledge base. A query is comprised of subject and description, while a historical ticket consists of subject, description and solution. To retrieve a relevant solution, we use textual similarity paradigm to learn similarity in the query and historical tickets. The task is challenging due to significant term mismatch in the query and ticket pairs of asymmetric lengths, where subject is a short text but description and solution are multi-sentence texts. We present a novel Replicated Siamese LSTM model to learn similarity in asymmetric text pairs, that gives 22% and 7% gain (Accuracy@10) for retrieval task, respectively over unsupervised and supervised baselines. We also show that the topic and distributed semantic features for short and long texts improved both similarity learning and retrieval.
研究动机与目标
- 解决工业工单系统中短查询与长历史工单之间语义相似度学习的挑战,其中术语不匹配和结构不对称性会阻碍检索效果。
- 通过建模查询-工单对各组件(主题、描述、解决方案)之间的多层次与跨层次语义相似度,提升信息检索性能。
- 通过分布式词嵌入、LSTM编码表示和神经主题建模作为互补输入通道,增强检索准确性。
- 在标注数据有限的真实工业应用中,证明新型复制型孪生LSTM架构的有效性。
- 克服现有孪生网络通常仅处理对称句子对的局限性,将其扩展至非对称、多组件文本对。
提出的方法
- 提出一种复制型孪生LSTM架构,其中双分支分别处理查询(SUB1+DESC1)和历史工单(SUB2+DESC2+SOL2)组件,采用共享权重以学习共享表示。
- 整合多通道输入:词嵌入(SumEMB)、LSTM编码隐藏状态(LSTM)和主题向量(T),以丰富语义表示。
- 定义多通道曼哈顿度量损失函数,通过加权L1距离计算所有组件对之间的成对相似度(例如,SUB1与SUB2、SUB1与DESC2等)。
- 将目标函数表述为表示之间加权L1距离的负指数形式:$ g = \exp\big(-\sum_{p,q} V_{\{p,q\}} (W_h\|h_p - h_q\|_1 + W_E\|E_p - E_q\|_1 + W_T\|T_p - T_q\|_1) \big) $。
- 使用DocNADE从文档中学习主题向量,以在描述和解决方案等长文本中实现主题感知的语义建模。
- 使用对比损失端到端训练模型,以优化相关查询-工单对之间的相似度得分。
实验结果
研究问题
- RQ1复制型孪生LSTM架构能否有效建模长度和结构各异的非对称文本对之间的语义相似度?
- RQ2整合多层次(主题、描述、解决方案)和多通道(词嵌入、LSTM、主题向量)表示是否能提升工业工单系统中的相似度学习效果?
- RQ3在真实世界工单数据上,所提模型与无监督和有监督基线相比,检索性能如何?
- RQ4主题建模与分布式语义特征在多大程度上增强了短文本和长文本组件中的相似度学习?
- RQ5在标注数据有限且存在显著术语不匹配的情况下,该模型能否在真实工业应用中实现良好泛化?
主要发现
- 所提出的复制型孪生LSTM模型在工业工单系统检索任务中,相比无监督基线,实现了Accuracy@10 22%的绝对提升。
- 该模型在有监督基线上实现了Accuracy@10 7%的绝对提升,表明即使在标注数据有限的情况下仍具备强大性能。
- 主题向量与分布式语义特征的整合显著增强了相似度学习,尤其在长篇描述和解决方案中表现突出。
- 跨层次相似度(例如,查询主题与工单解决方案)对检索性能有实质性贡献,验证了多层次建模方法的有效性。
- 与标准孪生网络相比,该模型通过显式建模多个组件和表示通道中的非对称文本对,表现更优。
- 该架构在不同工业领域中泛化良好,减少了对手工设计语言特征的依赖,具有广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。