Skip to main content
QUICK REVIEW

[论文解读] Overview of the TREC 2020 Fair Ranking Track

Asia J. Biega, Fernando Díaz|arXiv (Cornell University)|Aug 11, 2021
Ethics and Social Impacts of AI参考文献 11被引用 7
一句话总结

本论文介绍了 TREC 2020 公平排名赛道,该赛道通过优化基于经济发展水平(发达国家与欠发达国家)定义的作者群体的曝光度,评估了在学术搜索中平衡公平性与相关性的系统。表现最佳的系统使用了外部数据(例如,Google Scholar)和查询级排列方法,以减少曝光度差异,在重排序任务中实现了最低 $Δ_{\mathcal{G}}$ 为 0.428。

ABSTRACT

This paper provides an overview of the NIST TREC 2020 Fair Ranking track. For 2020, we again adopted an academic search task, where we have a corpus of academic article abstracts and queries submitted to a production academic search engine. The central goal of the Fair Ranking track is to provide fair exposure to different groups of authors (a group fairness framing). We recognize that there may be multiple group definitions (e.g. based on demographics, stature, topic) and hoped for the systems to be robust to these. We expected participants to develop systems that optimize for fairness and relevance for arbitrary group definitions, and did not reveal the exact group definitions until after the evaluation runs were submitted.The track contains two tasks,reranking and retrieval, with a shared evaluation.

研究动机与目标

  • 评估能够平衡学术搜索中相关性与公平性的排名系统,特别是确保来自不同经济发展背景的作者获得公平的曝光。
  • 通过在评估后才提供群体标签,评估系统对未知群体定义的鲁棒性。
  • 使用浏览模型和基于度量的评估方法,测量并优化不同作者群体之间的预期曝光差异。
  • 鼓励使用外部数据和查询级随机化方法,在不牺牲相关性的情况下提升公平性。
  • 使用真实世界语料库和查询数据,提供学术搜索中公平排名的标准化基准。

提出的方法

  • 使用浏览模型,折扣因子 $\gamma = 0.5$,根据文档位置和相关性计算每位作者的预期曝光。
  • 基于国家和经济发展水平将作者分组,将群体曝光 $\mathcal{E}_g$ 定义为群体 $g$ 内个体作者曝光的总和。
  • 使用 $\Delta_{\mathcal{G}} = \left(\sum_{g\in\mathcal{G}}(\mathcal{E}_g - \mathcal{E}_g^*)^2\right)^{1/2}$ 评估系统,其中 $\mathcal{E}_g^*$ 是通过相关性下降排列策略推导出的目标曝光。
  • 提供来自 Semantic Scholar 开放语料库的 186GB 语料库,包含论文元数据、作者数据和引用网络。
  • 允许多个查询排名以模拟现实世界中的查询曝光变化,系统需避免在检索训练中使用测试重排序集合。
  • 支持使用相同查询的重排序(查询特定文档重排)和检索(100 个文档的语料库级排名)任务进行评估。

实验结果

研究问题

  • RQ1如何设计排名系统,以在事先不知道群体定义的情况下,公平地在不同经济发展水平群体的作者之间分配曝光?
  • RQ2外部数据源(例如,Google Scholar、预训练嵌入)在多大程度上能改善学术搜索排名的公平性?
  • RQ3公平排名中相关性与曝光差异之间的权衡是什么?如何定量测量并优化这一权衡?
  • RQ4查询级排列和随机化策略在多大程度上能有效减少不同作者群体之间的曝光差异?
  • RQ5具有公平性感知目标的学习排序模型能否在学术搜索中实现更好的相关性与公平性平衡?

主要发现

  • 表现最佳的重排序系统(NLE_META_9_1)实现了 $\Delta_{\mathcal{G}}$ 为 0.428,表明其公平性表现优异,曝光差异极小。
  • 使用外部数据(如 Google Scholar)和查询级排列(如随机化或摊销)的系统,始终优于仅依赖内部特征的系统。
  • 顶级重排序结果表现出高相关性但曝光差异较低,表明公平性的提升主要源于曝光不平衡的减少。
  • 检索任务的 $\Delta_{\mathcal{G}}$ 值更高,最佳结果(UW_t_bm25)达到 0.748,表明在大规模场景下平衡公平性更具挑战。
  • 将出版年份作为特征,以及使用基于图的作者群体社区进行群体检测,是新颖策略,对顶级提交结果的公平性提升有显著贡献。
  • 使用每个查询的多个排名,能够更好地建模现实世界的曝光动态,并提高公平性评估的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。