[论文解读] Learning to Ask Good Questions: Ranking Clarification Questions using Neural Expected Value of Perfect Information
本文提出了一种基于期望完美信息价值(EVPI)的神经排序模型,用于澄清问题,将优质问题定义为:其可能的回答能显著提升帖子的信息量。在包含77,000个样本的新StackExchange数据集上进行评估,该模型在排序有用澄清问题方面优于基线模型,表明基于EVPI的效用估计能有效捕捉澄清问题的语用质量。
Inquiry is fundamental to communication, and machines cannot effectively collaborate with humans unless they can ask questions. In this work, we build a neural network model for the task of ranking clarification questions. Our model is inspired by the idea of expected value of perfect information: a good question is one whose expected answer will be useful. We study this problem using data from StackExchange, a plentiful online resource in which people routinely ask clarifying questions to posts so that they can better offer assistance to the original poster. We create a dataset of clarification questions consisting of ~77K posts paired with a clarification question (and answer) from three domains of StackExchange: askubuntu, unix and superuser. We evaluate our model on 500 samples of this dataset against expert human judgments and demonstrate significant improvements over controlled baselines.
研究动机与目标
- 开发一种神经网络模型,根据其在提升帖子信息量方面的预期效用,对澄清问题进行排序。
- 解决在协作环境中识别哪项缺失信息最有助于解决用户查询的挑战。
- 创建一个大规模、由专家标注的StackExchange澄清问题数据集,以支持该任务的研究。
- 将决策理论原则(EVPI)与深度学习相结合,用于人机协作中的语用问题排序。
- 使系统能够在内容创作过程中主动建议澄清问题,从而提高响应效率。
提出的方法
- 将任务建模为使用期望完美信息价值(EVPI)对候选澄清问题进行排序,其中效用定义为帖子信息量的预期提升。
- 使用神经网络估计在给定帖子和问题时每个答案的概率,建模为 P(a_j | p, q_i)。
- 采用神经效用函数 U(p + a_j) 衡量给定答案使帖子变得多完整。
- 使用可微分损失函数联合训练答案概率模型与效用模型,以同时优化准确率与相关性。
- 利用相似StackExchange帖子的检索生成候选问题与答案,使用基于Lucene的相似性进行候选生成。
- 应用答案表示学习,将答案与问题上下文对齐,使用原始答案和改写答案作为监督信号。
实验结果
研究问题
- RQ1我们如何在问题被提出之前建模其预期效用?
- RQ2哪种神经架构最能捕捉问题在提升帖子信息量方面的语用价值?
- RQ3基于EVPI的效用估计是否能在澄清问题排序任务中超越强基线模型?
- RQ4该模型在不同技术问答论坛领域中的泛化能力如何?
- RQ5问题的哪些特征使其更可能在协作式问题解决中引发有用信息?
主要发现
- 基于EVPI的神经模型在专家标注的测试集上显著优于基线模型,证明其在排序有用澄清问题方面具有优势。
- 该模型在检索原始澄清问题以及从候选集中识别出任意专家评分良好的问题任务上均表现出色。
- 所提出的约77,000个(帖子,问题,答案)三元组数据集,为澄清问题排序模型的训练与评估提供了坚实基础。
- 将EVPI与深度学习结合,能有效建模语用性问题选择,捕捉相关性与信息量之间的平衡。
- 人工标注证实,该模型的预测结果与专家判断高度一致,尤其倾向于选择范围广泛、可回答的问题,而非过度具体或无关的问题。
- 该模型在不同领域(AskUbuntu、Unix、Superuser)间具有良好的泛化能力,对技术术语和用户行为差异表现出鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。