Skip to main content
QUICK REVIEW

[论文解读] Sanity Check: A Strong Alignment and Information Retrieval Baseline for Question Answering

Vikas Yadav, Rebecca Sharp|arXiv (Cornell University)|Jul 5, 2018
Topic Modeling参考文献 33被引用 6
一句话总结

本文提出了一种简单、无监督且快速的阅读理解基线方法,利用预训练的GloVe词嵌入进行一对一的词对齐与负样本对齐。尽管模型结构极为简单且无需训练,其性能仍接近当前最先进水平——在ScienceQA数据集上达到47%的P@1,在Yahoo! Answers数据集上达到32.9%的P@1,在WikiQA数据集上达到64%的MAP,优于传统基线模型以及多个复杂的有监督模型。

ABSTRACT

While increasingly complex approaches to question answering (QA) have been proposed, the true gain of these systems, particularly with respect to their expensive training requirements, can be inflated when they are not compared to adequate baselines. Here we propose an unsupervised, simple, and fast alignment and information retrieval baseline that incorporates two novel contributions: a extit{one-to-many alignment} between query and document terms and extit{negative alignment} as a proxy for discriminative information. Our approach not only outperforms all conventional baselines as well as many supervised recurrent neural networks, but also approaches the state of the art for supervised systems on three QA datasets. With only three hyperparameters, we achieve 47\% P@1 on an 8th grade Science QA dataset, 32.9\% P@1 on a Yahoo! answers QA dataset and 64\% MAP on WikiQA. We also achieve 26.56\% and 58.36\% on ARC challenge and easy dataset respectively. In addition to including the additional ARC results in this version of the paper, for the ARC easy set only we also experimented with one additional parameter -- number of justifications retrieved.

研究动机与目标

  • 为解决现代阅读理解研究中缺乏严谨基线比较的问题,尤其是在复杂模型评估时缺乏强有力的参照点。
  • 证明基于词法与语义对齐的简单无监督方法可超越更复杂的有监督模型。
  • 提出一种仅使用三个超参数和预训练词嵌入的最小但有效的基线方法。
  • 表明负样本对齐与一对多的术语匹配可提升上下文建模与答案判别能力。
  • 鼓励社区采用更强、更透明的基线,以实现对阅读理解系统更公平的评估。

提出的方法

  • 该方法使用预训练的300维GloVe词嵌入,通过余弦相似度计算问题词与候选答案词之间的相似度。
  • 采用一对多对齐机制,允许单个问题词映射到答案中多个语义相似的词,从而增强上下文敏感性。
  • 利用负样本对齐作为判别性信息的代理,有助于区分正确答案与看似合理但错误的答案。
  • 对每个问题词局部计算逆文档频率(IDF),以加权词的重要性。
  • 答案相关性得分基于最高排名的正样本与负样本对齐得分之和,通过调节三个超参数进行优化:对齐阈值、负样本对齐权重以及保留的最高对齐数量。
  • 该方法完全无监督,无需任何训练或微调。

实验结果

研究问题

  • RQ1基于词法与语义对齐的简单无监督方法是否能在阅读理解任务中超越复杂的有监督神经网络?
  • RQ2与一对一映射相比,引入一对多术语对齐是否能提升答案相关性估计的性能?
  • RQ3负样本对齐能否作为答案选择中判别性信息的有效代理?
  • RQ4是否存在一个‘恰到好处’的对齐密度区间,使得性能在噪声干扰下达到峰值后开始下降?
  • RQ5在多样化的阅读理解数据集上,一个极简且超参数极少的基线方法在多大程度上可逼近最先进性能?

主要发现

  • 所提出的无监督基线在8年级ScienceQA数据集上达到47.00%的P@1,显著优于BM25和LCLR基线。
  • 在Yahoo! Answers数据集上,其P@1达到32.9%,超过BM25,表明语义对齐在词面重叠之外具有显著优势。
  • 在WikiQA数据集上,模型取得64.00%的MAP,比强大的LCLR基线高出+4.10个百分点。
  • 在ARC数据集上,其在简单集上达到58.36%的P@1,在挑战集上达到26.56%的P@1,接近BiDAF和DGEM等有监督模型的性能。
  • 在所有数据集上,同时包含正样本与负样本对齐的完整模型均优于一对一和一对多基线,且在WikiQA与Yahoo! QA中具有统计显著性。
  • 尽管模型结构极为简单,其性能已接近近期有监督系统平均水平,并超越所有传统基线,表明设计良好的基线对实现公平评估至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。