Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforced Query Reformulation for Information Retrieval

Xiao Wang, Craig Macdonald|arXiv (Cornell University)|Jul 15, 2020
Web Data Mining and Analysis参考文献 43被引用 12
一句话总结

本文提出深度强化查询重写(DRQR),一种基于强化学习的序列到序列模型,通过生成查询同义表达来解决信息检索中的词汇不匹配问题。通过将查询性能预测整合到奖励函数中,DRQR生成的重写结果能提升检索效果,在TREC 2020深度学习赛道数据集上优于基线模型,并在与BM25、查询扩展和BERT排序模型结合时进一步提升性能。

ABSTRACT

Query reformulations have long been a key mechanism to alleviate the vocabulary-mismatch problem in information retrieval, for example by expanding the queries with related query terms or by generating paraphrases of the queries. In this work, we propose a deep reinforced query reformulation (DRQR) model to automatically generate new reformulations of the query. To encourage the model to generate queries which can achieve high performance when performing the retrieval task, we incorporate query performance prediction into our reward function. In addition, to evaluate the quality of the reformulated query in the context of information retrieval, we first train our DRQR model, then apply the retrieval ranking model on the obtained reformulated query. Experiments are conducted on the TREC 2020 Deep Learning track MSMARCO document ranking dataset. Our results show that our proposed model outperforms several query reformulation model baselines when performing retrieval task. In addition, improvements are also observed when combining with various retrieval models, such as query expansion and BERT.

研究动机与目标

  • 通过自动生成有效的查询重写来解决信息检索中的词汇不匹配问题。
  • 通过将查询性能预测整合到强化学习奖励函数中,提升文本生成训练目标与实际检索效果之间的对齐。
  • 评估DRQR在与BM25、查询扩展和BERT等现有检索模型结合时是否能提升检索性能。
  • 探究奖励权衡超参数的影响以及查询性能预测器在指导学习过程中的作用。

提出的方法

  • DRQR采用带有注意力机制和复制机制的序列到序列模型,从输入查询生成查询重写。
  • 该模型使用深度强化学习,其中策略网络生成重写,奖励函数指导学习过程。
  • 奖励函数结合了通过查询性能预测器(QPP)预测的检索效果与标准序列生成损失,使用权衡超参数λ。
  • 使用如AvgSCQ等查询性能预测器,在执行检索前估算重写查询的预期检索效果。
  • 模型在TREC 2020深度学习赛道MSMARCO数据集上进行端到端训练,并使用验证集调优超参数θ和λ。
  • 通过将检索模型(如DPH、DPH+QE、DPH+BERT)应用于原始查询和重写查询,评估该方法的有效性。

实验结果

研究问题

  • RQ1RQ1:与标准序列到序列基线相比,深度强化学习模型能否生成提升检索效果的查询重写?
  • RQ2RQ2:将查询性能预测整合到奖励函数中,是否能生成比标准强化学习或序列到序列模型更有效的重写?
  • RQ3RQ3:DRQR能否与查询扩展(QE)或BERT重排序等其他检索增强技术有效结合,进一步提升性能?
  • RQ4RQ4:奖励权衡超参数λ如何影响DRQR在不同检索模型上的性能表现?

主要发现

  • 与原始查询(q0)相比,DRQR在3个检索设置中的NDCG@10均有所提升,在3个设置中的MAP有2个提升,显示出一致但适中的增益。
  • 在DPH+QE设置中,DRQR的NDCG@10达到0.6017,略高于基线DPH+QE的0.6008。
  • 在DPH+BERT设置中,DRQR将NDCG@10从0.5722提升至0.5773,显示出对原始查询的可测量改进。
  • 最优奖励权衡超参数λ被确定为0.3或0.5,因为这两个值在所有检索模型上均使NDCG@10最大化。
  • 仅43个测试查询中的35个被DRQR重写,表明其策略较为保守,受QPP组件影响显著。
  • 模型生成的重写常以'what is'开头,表明由于文本生成中缺乏预训练嵌入,存在对问题类n-gram的偏向。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。