[论文解读] Overview of the TREC 2020 deep learning track
本文报道了第二届 TREC 深度学习竞赛(Deep Learning Track),在大规模训练数据条件下比较神经方法(特别是 BERT 风格)与传统排序方法用于文档与段落检索,并分析端到端与重新排序(rerank)范式以及 ORCAS 数据集的影响。
This is the second year of the TREC Deep Learning Track, with the goal of studying ad hoc ranking in the large training data regime. We again have a document retrieval task and a passage retrieval task, each with hundreds of thousands of human-labeled training queries. We evaluate using single-shot TREC-style evaluation, to give us a picture of which ranking methods work best when large data is available, with much more comprehensive relevance labeling on the small number of test queries. This year we have further evidence that rankers with BERT-style pretraining outperform other rankers in the large data regime.
研究动机与目标
- 在大数据环境下,为临时排序提供大型、可重复使用的训练和测试数据集。
- 建立一个严格、盲目的一次性评估,以比较排序方法。
- 评估文档检索和段落检索,采用端到端和重新排序的设置。
- 分析 ORCAS 数据及不同标签方案对评估的影响。
- 鼓励多样化的方法并分析与上一年的学习。
提出的方法
- 提供两个大型训练数据集(文档和段落)及相应的测试集合。
- 将一个大型 ORCAS 点击数据集作为额外训练数据或文档字段纳入。
- 将提交的运行分类为 nnlm、nn、trad,以比较基于预训练语言模型的、神经网络的和传统方法。
- 使用 NDCG@10 与四点 NIST 判定进行评估,以及补充指标(RR MS、RR、AP、NCg@k)。
- 区分端到端 fullrank 与 reranking(rerank),以评估哪个阶段对性能贡献更大。
- 分析 MS MARCO 与 NIST 标签之间的跨数据集一致性,并比较 ORCAS 数据对性能的影响。
实验结果
研究问题
- RQ1BERT 风格的预训练模型(nnlm)在文档与段落检索的大数据 IR 参数下是否优于其他方法?
- RQ2端到端全排序 vs 重新排序对前 k 名次的影响有多大?
- RQ3ORCAS 数据集如何影响性能以及 MS MARCO 与 NIST 基于标签的评估之间的一致性?
- RQ4在大量训练数据条件下,传统 IR 方法是否能与神经方法竞争,在哪些条件下会失败?
- RQ5评估标签选择(NIST vs MS MARCO)如何影响对模型有效性的结论?
主要发现
- nnlm 运行在两个任务的 NDCG@10 指标上,优于 trad 和 nn 运行。
- 在文档检索中,最佳的 nnlm/运行在 NDCG@10 上比最佳的 trad 高出 23%;最佳的 nn 高出 11%;在段落检索中,差距分别为 42% 和 17%。
- 端到端 fullrank 未必比 rerank 持续地优于后者,在某些 top 运行中为 rerank,而 fullrank 有时追平或略超越 rerank。
- 使用 ORCAS 数据通常在同一组内提高 NDCG@10,尽管并非达到最高分即成为必要;观察到的最大提升约为 0.0513 在 NDCG@10。
- MS MARCO 与 NIST 标签的一致性因任务而异,文档检索的 Kendall tau 为 0.46,段落检索为 0.69;ORCAS 的使用影响这些相关性。
- 该竞赛产生了更为多样的提交(包括更多的 nnlm 与 fullrank/rerank 的比较),并为未来研究提供了可重复使用的测试数据集合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。