Skip to main content
QUICK REVIEW

[论文解读] Identifying Well-formed Natural Language Questions

Manaal Faruqui, Dipanjan Das|arXiv (Cornell University)|Aug 28, 2018
Topic Modeling参考文献 30被引用 5
一句话总结

本文提出了一项新任务,用于识别语法正确的自然语言问题,并基于新构建的25,100个标注查询数据集,训练了一个神经分类器。该模型在区分语法正确与语法错误的问题上达到了70.7%的准确率,并在用于重排序神经问题生成结果时,使生成性能提升了0.2 BLEU分数。

ABSTRACT

Understanding search queries is a hard problem as it involves dealing with "word salad" text ubiquitously issued by users. However, if a query resembles a well-formed question, a natural language processing pipeline is able to perform more accurate interpretation, thus reducing downstream compounding errors. Hence, identifying whether or not a query is well formed can enhance query understanding. Here, we introduce a new task of identifying a well-formed natural language question. We construct and release a dataset of 25,100 publicly available questions classified into well-formed and non-wellformed categories and report an accuracy of 70.7% on the test set. We also show that our classifier can be used to improve the performance of neural sequence-to-sequence models for generating questions for reading comprehension.

研究动机与目标

  • 为解决NLP系统中因处理非正式、语法错误的搜索查询而导致意图理解不准确的挑战。
  • 定义并建立一项新的基准任务,用于识别用户查询中的语法正确自然语言问题。
  • 构建并发布一个大规模、众包标注的数据集,包含25,100个查询及其语法正确性概率,以支持该新任务。
  • 展示语法正确性分类作为信号在提升下游NLP任务(尤其是神经问题生成)中的实用性。

提出的方法

  • 使用五名众包标注员对Paralex语料库中的25,100个查询进行标注,基于共识计算语法正确性概率。
  • 通过三个标准定义语法正确性:语法正确性、明确的问题结构以及无拼写错误。
  • 使用从每个查询中提取的词汇和句法特征,训练一个前馈神经网络分类器。
  • 将模型的语法正确性概率作为特征,用于神经序列到序列问题生成的判别性重排序模型。
  • 在开发集上通过BLEU分数优化重排序器,结合模型置信度和语法正确性概率作为特征。
  • 在包含3,850个查询的测试集上评估最终系统,并使用BLEU-1和BLEU-4指标评估问题生成性能。

实验结果

研究问题

  • RQ1机器学习模型能否准确分类用户查询是否为语法正确的自然语言问题?
  • RQ2语法正确性概率在提升神经问题生成模型性能方面有多有效?
  • RQ3词汇和句法特征在语法正确性分类中的贡献程度如何?
  • RQ4人类对语法正确性的判断是否一致?共识能否提高判断的可靠性?
  • RQ5通过重排序提升语法正确性是否能带来更好的自动评估指标表现?

主要发现

  • 所提出的分类器在3,850个查询的测试集上达到70.7%的准确率,为该新任务提供了强有力的基线。
  • 数据集中76.5%的样本(19,206个查询)获得了至少四位标注员的一致判断,表明语法正确性判断具有较高的标注者间一致性。
  • 当用于重排序10个最佳生成结果时,语法正确性分类器使神经序列到序列问题生成模型的性能提升了0.2 BLEU-4分。
  • 该模型在处理长距离句法依赖方面表现不佳,例如主语-动词一致性的错误(如将'did'与过去时动词搭配使用),导致误分类。
  • 即使问题语法非常正确,其BLEU分数仍可能低于语法较差但更匹配参考答案的替代方案,表明流畅性与词汇匹配之间存在权衡。
  • 该数据集已公开发布于 http://goo.gl/language/query-wellformedness,为未来在查询理解与问题生成方面的研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。