[论文解读] A Study of Question Effectiveness Using Reddit "Ask Me Anything" Threads
本文提出一种上下文感知卷积神经网络(CNN),用于预测Reddit 'Ask Me Anything'(AMA)帖子中哪些问题会被主持人回答,基于包含40万道问题的大规模数据集。该模型在1万道验证集上取得了53.7%的F1分数,优于基线模型,并在问题有效性方面与人类判断表现出良好一致性。
Asking effective questions is a powerful social skill. In this paper we seek to build computational models that learn to discriminate effective questions from ineffective ones. Armed with such a capability, future advanced systems can evaluate the quality of questions and provide suggestions for effective question wording. We create a large-scale, real-world dataset that contains over 400,000 questions collected from Reddit "Ask Me Anything" threads. Each thread resembles an online press conference where questions compete with each other for attention from the host. This dataset enables the development of a class of computational models for predicting whether a question will be answered. We develop a new convolutional neural network architecture with variable-length context and demonstrate the efficacy of the model by comparing it with state-of-the-art baselines and human judges.
研究动机与目标
- 开发计算模型,以自动评估真实网络问答场景中问题的有效性。
- 探究问题措辞和上下文是否会影响问题是否被AMA主持人回答。
- 构建一个大规模、真实世界的社区驱动问答论坛中问题可回答性的数据集。
- 将机器预测与人类判断及AMA主持人行为进行比较,以评估模型性能和一致性。
- 探索影响某些问题更可能被回答的因素,包括语义、句法和主题特征。
提出的方法
- 从Reddit AMA帖子中构建了包含40万道问题的大规模数据集,涵盖帖子标题、主持人介绍和用户问题。
- 设计了一种新颖的上下文感知CNN架构,可处理可变长度的上下文,并结合多种n-gram滤波窗口(1–5-gram)及不同滤波器数量。
- 使用单字、双字、三字及更高阶n-gram特征联合训练模型,以捕捉局部和分布式的语义模式。
- 使用1万道验证集评估模型性能,并与最先进基线模型及人类标注者进行比较。
- 通过Amazon Mechanical Turk开展人类评估研究,5名标注者对同一AMA帖子中的300对问题进行标注,以评估偏好和一致性。
- 将人类标注者的多数投票结果作为人类判断的代理,并将模型预测与人类判断及主持人行为进行对比。
实验结果
研究问题
- RQ1哪些问题特征使其更可能被AMA主持人回答?
- RQ2深度学习模型能否有效基于问题措辞和上下文预测其是否会被回答?
- RQ3人类对问题有效性的判断与AMA主持人实际选择之间的一致性如何?
- RQ4模型预测性能在多大程度上与人类共识一致,而非主持人行为?
- RQ5训练数据规模如何影响问题可回答性预测模型的泛化能力和稳定性?
主要发现
- 上下文感知CNN模型在1万道验证集上取得了53.7%的F1分数,优于单个基线CNN模型和最先进方法。
- 当使用300个滤波器和1个词窗口时,模型表现最佳,表明其预测高度依赖于单字特征。
- 人类标注者在63%的问题对中达成一致(5人中有4人及以上同意),其中30%实现全部5人一致。
- 人类标注者与AMA主持人在55%的问题对中达成一致,而模型与人类判断的一致性略高(54.33%),高于与主持人行为的一致性(49.33%)。
- 一名本科生标注者与人类标注者达成68.6%的一致性,优于模型与主持人行为的一致性(49.33%)。
- 随着训练数据规模增加,模型性能稳步提升,在10万条训练样本时达到53.7%的F1分数峰值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。