[论文解读] Question Retrieval for Community-based Question Answering via Heterogeneous Network Integration Learning
该论文提出 HNIL,一种异质网络融合学习框架,通过联合建模问题文本、用户社交网络和类别信息,利用随机游走与基于 RNN 的表征学习,提升基于社区的问答平台中的问题检索性能。在 Quora 数据集上的实验表明,HNIL 显著优于当前最先进方法,MRR 最高达到 53.22%,MAP 达到 40.67%,证明了融合社交与文本信号在语义问题匹配中的有效性。
Community based question answering platforms have attracted substantial users to share knowledge and learn from each other. As the rapid enlargement of CQA platforms, quantities of overlapped questions emerge, which makes users confounded to select a proper reference. It is urgent for us to take effective automated algorithms to reuse historical questions with corresponding answers. In this paper we focus on the problem with question retrieval, which aims to match historical questions that are relevant or semantically equivalent to resolve one s query directly. The challenges in this task are the lexical gaps between questions for the word ambiguity and word mismatch problem. Furthermore, limited words in queried sentences cause sparsity of word features. To alleviate these challenges, we propose a novel framework named HNIL which encodes not only the question contents but also the askers social interactions to enhance the question embedding performance. More specifically, we apply random walk based learning method with recurrent neural network to match the similarities between askers question and historical questions proposed by other users. Extensive experiments on a large scale dataset from a real world CQA site show that employing the heterogeneous social network information outperforms the other state of the art solutions in this task.
研究动机与目标
- 解决由于词语歧义和问题长度短导致的问题检索中的词汇鸿沟与词稀疏问题。
- 改善缺乏词汇重叠的语义等价问题之间的语义匹配。
- 利用用户社交网络互动和问题类别信息作为辅助信号,提升问题嵌入质量。
- 构建一个统一框架,整合文本、社交与类别信息,以提升检索性能。
- 在真实 CQA 场景中,证明监督式多模态学习相较于传统无监督或仅文本方法的优越性。
提出的方法
- 在结合用户、问题和类别的异质网络上执行随机游走,生成用户与问题的路径序列。
- 使用双向 RNN 将随机游走获得的节点序列编码为密集且上下文感知的用户与问题嵌入。
- 将 RNN 学习得到的用户嵌入与问题的文本嵌入(来自独立的 RNN)拼接,形成统一的问题表征。
- 使用对比损失端到端训练模型,以最大化语义等价问题之间的相似性,同时最小化非等价问题之间的相似性。
- 将问题类别信息作为监督信号,引导表征学习并提升类别内相似性。
- 将学习到的嵌入用于基于语义相似度对历史问题进行排序,以匹配新查询问题。
实验结果
研究问题
- RQ1整合用户社交网络互动是否能提升 CQA 平台中问题检索的语义问题表征?
- RQ2与仅使用文本的模型相比,结合问题文本内容与用户侧信息(如社交网络)对检索性能有何影响?
- RQ3类别监督在多大程度上能增强语义有意义的问题嵌入学习?
- RQ4基于异质网络的随机游走策略是否能有效捕捉用户与问题之间的潜在关系以支持检索?
- RQ5一个联合建模文本、社交与类别信号的深度学习框架,是否能超越当前最先进监督与无监督基线方法?
主要发现
- HNIL 在所有指标上均取得最高性能:在 80% 训练数据上,MRR 达 53.22%,MAP 达 40.67%,显著优于所有基线模型。
- 在 80% 训练数据上,模型达到 41.01% 的 Precision@5,表明其在前 5 名检索中的准确率表现优异。
- 当在 60% 数据上训练时,HNIL 的 MRR 达 47.90%,证明其在标注数据有限的情况下仍具鲁棒性。
- 消融实验表明,路径长度为 6 时在所有指标上均达到最优性能,证实了其对超参数选择的敏感性。
- 监督方法(如 HNIL、DRLM、RCNNs)始终优于无监督方法(如 VSM、BM25、Doc2Vec),证明了类别监督的价值。
- 社交网络信息与文本内容的融合使 MRR 相较于仅使用文本的模型提升了 15–20%,验证了该框架设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。