Skip to main content
QUICK REVIEW

[论文解读] Question Relatedness on Stack Overflow: The Task, Dataset, and Corpus-inspired Models

Amirreza Shirani, Bowen Xu|arXiv (Cornell University)|May 2, 2019
Expert finding and Q&A systems被引用 11
一句话总结

本文在 Stack Overflow 上提出了一项多类别问题相关性任务,将知识单元对分类为重复、直接、间接或孤立。该研究构建了一个包含三十余万对标注样本的大规模数据集,并提出了一种基于 BiLSTM 的模型(DotBiLSTM)和一种基于软余弦相似度的 SVM 模型,两者在重复检测任务上均优于当前最先进方法,其中 DotBiLSTM 在四分类任务上达到 75% 的 F-micro 分数,在重新表述的二分类重复检测任务上达到 91%。

ABSTRACT

Domain-specific community question answering is becoming an integral part of professions. Finding related questions and answers in these communities can significantly improve the effectiveness and efficiency of information seeking. Stack Overflow is one of the most popular communities that is being used by millions of programmers. In this paper, we analyze the problem of predicting knowledge unit (question thread) relatedness in Stack Overflow. In particular, we formulate the question relatedness task as a multi-class classification problem with four degrees of relatedness. We present a large-scale dataset with more than 300K pairs. To the best of our knowledge, this dataset is the largest domain-specific dataset for Question-Question relatedness. We present the steps that we took to collect, clean, process, and assure the quality of the dataset. The proposed dataset Stack Overflow is a useful resource to develop novel solutions, specifically data-hungry neural network models, for the prediction of relatedness in technical community question-answering forums. We adopt a neural network architecture and a traditional model for this task that effectively utilize information from different parts of knowledge units to compute the relatedness between them. These models can be used to benchmark novel models, as they perform well in our task and in a closely similar task.

研究动机与目标

  • 为领域特定社区问答平台中的多类别问题相关性检测任务进行定义与形式化,尤其聚焦于 Stack Overflow 平台。
  • 构建一个大规模、高质量的数据集,包含三十余万个问题线程对,其相关性被标注为四种程度:重复、直接、间接和孤立。
  • 开发并基准测试有效的模型——包括神经网络与传统机器学习模型——用于预测技术论坛中的相关性。
  • 在所提出的多类别任务和一个密切相关的二分类重复检测任务上评估模型性能,以实现跨比较。

提出的方法

  • 将相关性任务形式化为一个具有四个标签的多类别分类问题:重复、直接、间接和孤立。
  • 通过在 Stack Overflow 上分析 URL 共享模式收集大规模数据集,其中共享的 URL 表示感知到的相关性。
  • 通过多阶段数据清洗与质量保障措施,包括专家标注和用户研究,以验证可靠性。
  • 采用一种轻量级双向长短期记忆网络(BiLSTM),并引入点积注意力机制(DotBiLSTM),用于建模问题线程之间的语义相似性。
  • 使用从标题、正文和回答文本中手工提取的软余弦相似度特征,训练支持向量机(SVM)模型。
  • 在原始四分类任务和重新表述的二分类重复检测任务上对模型进行评估,并通过欠采样实现类别平衡,以确保公平性。

实验结果

研究问题

  • RQ1在技术论坛如 Stack Overflow 中,如何有意义地将问题相关性划分为多种相似度等级,而不仅限于简单的重复/非重复?
  • RQ2在社区问答平台中,使用 URL 共享作为相关性代理的可靠性与可扩展性如何?
  • RQ3在特定领域设置下,神经网络与传统机器学习模型在大规模多类别问题相关性检测任务上的表现如何?
  • RQ4在该数据集上训练的模型在泛化到相关任务(如二分类重复检测)方面的能力如何?与当前最先进方法相比表现如何?

主要发现

  • 所提出的数据集包含超过三十余万个问题线程对,标注为四种相关性类别,是迄今为止最大的领域特定相关性数据集。
  • DotBiLSTM 模型在四分类相关性分类任务上达到 75% 的 F-micro 分数,显著优于 SoftSVM 模型(59% F-micro)。
  • 在重新表述的二分类重复检测任务上,DotBiLSTM 达到 91% 的 F-score,表明其在问题的简化但常见变体上表现优异。
  • 使用手工构建的软余弦特征的 SoftSVM 模型在二分类任务上达到 70% 的 F-score,尽管其为传统方法,仍表现出良好竞争力。
  • 两种模型在 AskUbuntu 数据集上的表现均优于当前最先进方法 Hybrid DCNN 模型,分别达到 88% 和 90% 的 F-score,表明其在不同数据集上的鲁棒性。
  • 用户研究证实,使用 URL 共享作为相关性代理具有可靠性,验证了数据集构建方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。