[论文解读] Implicit Negative Feedback in Clinical Information Retrieval
本文提出通过使用否定标注和分数组合,利用临床搜索查询中否定词的隐式负反馈来提升检索性能。通过将否定词视为负相关性信号而非直接删除,该方法在TREC CDS赛道数据上将否定词对早期精确率的负面影响降低了高达65%。
In this paper, we reflect on ways to improve the quality of bio-medical information retrieval by drawing implicit negative feedback from negated information in noisy natural language search queries. We begin by studying the extent to which negations occur in clinical texts and quantify their detrimental effect on retrieval performance. Subsequently, we present a number of query reformulation and ranking approaches that remedy these shortcomings by resolving natural language negations. Our experimental results are based on data collected in the course of the TREC Clinical Decision Support Track and show consistent improvements compared to state-of-the-art methods. Using our novel algorithms, we are able to reduce the negative impact of negations on early precision by up to 65%.
研究动机与目标
- 解决临床搜索查询中否定词对检索性能的负面影响。
- 探究将否定词视为负反馈是否比简单删除更能提升检索质量。
- 评估新型查询自适应检索模型,其整合了对否定敏感的表示方法。
- 量化临床决策支持场景下含否定与不含否定查询之间的性能差距。
- 证明否定标注与分数组合在缓解否定词负面影响方面的有效性。
提出的方法
- 应用否定检测技术,利用在BioScope语料库上训练的条件随机场模型,识别临床病例叙述中的否定词。
- 使用否定标注,将否定词在查询中表示为负相关性信号,避免其被删除。
- 实施一种分数组合方法,保持独立的正向与负向查询表示,通过学习得到的加权参数β组合其分数。
- 在TREC 2014和2015临床决策支持赛道数据上训练并评估检索模型,使用P@10、nDCG、infAP和RPrec等标准指标。
- 对比基线检索方法、否定过滤、分数组合与否定标注在含否定与不含否定查询上的表现。
- 对否定标注采用非自适应β参数,并在分数组合中探索自适应β以提升高否定查询的性能。
实验结果
研究问题
- RQ1与非否定查询相比,临床查询中存在否定词如何影响检索性能?
- RQ2将否定词视为负反馈是否比删除它们更能有效提升检索性能?
- RQ3在不同类型的查询中,哪种检索方法——否定过滤、分数组合还是否定标注——能带来最一致的性能提升?
- RQ4否定感知模型在多大程度上可以缩小否定查询与非否定查询之间的性能差距?
- RQ5分数组合中β的选择如何影响性能?自适应β选择是否能进一步提升结果?
主要发现
- 含否定词的查询(D−)性能显著低于非否定查询(D+),P@10下降10.8%,nDCG下降21.3%。
- 否定标注与分数组合将D−与D+在P@10上的性能差距缩小了65.4%,使D−的P@10提升了7.1个百分点。
- 在包含最多否定信息的Topic 1中,分数组合相比基线在P@10上实现了300%的相对提升。
- 否定标注在所有指标上均优于基线和过滤方法,同时保持性能并有效缓解了否定词的负面影响。
- 采用最优β参数的分数组合在高否定查询上取得了最高提升,尽管未发现β符号与查询特征之间存在系统性关联。
- 结果表明,将否定词视为负反馈比直接删除更有效,尤其在提升复杂临床查询的早期精确率方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。