Skip to main content
QUICK REVIEW

[论文解读] Reasoning over Public and Private Data in Retrieval-Based Systems

Simran Arora, Patrick A. Lewis|arXiv (Cornell University)|Mar 14, 2022
Privacy-Preserving Technologies in Data被引用 4
一句话总结

本文提出了公共-私有自回归信息检索(PAIR)框架,用于在公共和私有数据上实现隐私保护的检索;提出了ConcurrentQA基准,用于多分布、多跳问答任务;并表明现有系统在此场景下面临显著的隐私-性能权衡,可通过选择性预测和对多个数据分布的并发检索来缓解。

ABSTRACT

Users and organizations are generating ever-increasing amounts of private data from a wide range of sources. Incorporating private data is important to personalize open-domain applications such as question-answering, fact-checking, and personal assistants. State-of-the-art systems for these tasks explicitly retrieve relevant information to a user question from a background corpus before producing an answer. While today's retrieval systems assume the corpus is fully accessible, users are often unable or unwilling to expose their private data to entities hosting public data. We first define the PUBLIC-PRIVATE AUTOREGRESSIVE INFORMATION RETRIEVAL (PAIR) privacy framework for the novel retrieval setting over multiple privacy scopes. We then argue that an adequate benchmark is missing to study PAIR since existing textual benchmarks require retrieving from a single data distribution. However, public and private data intuitively reflect different distributions, motivating us to create ConcurrentQA, the first textual QA benchmark to require concurrent retrieval over multiple data-distributions. Finally, we show that existing systems face large privacy vs. performance tradeoffs when applied to our proposed retrieval setting and investigate how to mitigate these tradeoffs.

研究动机与目标

  • 为解决缺乏能够同时访问公共和私有数据以支持个性化应用的隐私感知检索系统的问题。
  • 识别出当前多跳检索系统在从公共源检索时会暴露私有数据,从而造成关键的隐私漏洞。
  • 提出一个新的基准ConcurrentQA,用于评估系统在多个数据分布(公共和私有)上并发检索的能力。
  • 研究在处理不同隐私范围的数据时,基于检索的系统所面临的隐私-性能权衡。
  • 探索选择性预测和并发检索等方法,以在保持性能的同时减轻隐私泄露。

提出的方法

  • 提出PAIR(公共-私有自回归信息检索)框架,以形式化定义在多个隐私范围上的检索,确保在公共检索过程中不暴露私有数据。
  • 设计ConcurrentQA,这是首个要求从公共和私有数据分布中检索的多跳问答基准,其问题需要同时从两个来源获取信息。
  • 采用迭代的、基于束搜索的多跳检索,其中每一步检索均基于问题和先前检索到的文档来获取下一条信息,但对检索序列施加隐私约束。
  • 引入选择性预测作为缓解策略,即当早期步骤涉及私有数据时,系统避免检索公共数据,从而降低暴露风险。
  • 开发并发检索机制,允许对公共和私有语料库进行同时或并行访问,避免需要将私有数据暴露给公共系统。
  • 结合使用稀疏(BM25)和密集检索模型,以在新基准上评估不同检索策略的性能。

实验结果

研究问题

  • RQ1如何设计基于检索的系统,使其能够在不损害用户隐私的前提下,对公共和私有数据进行推理?
  • RQ2当私有数据在公共数据之前被检索时,自回归多跳检索会引入哪些关键隐私风险?
  • RQ3现有检索模型在需要同时访问公共和私有数据分布的基准上的表现如何?
  • RQ4在多源、多分布设置中,隐私保护与检索性能之间存在哪些权衡?
  • RQ5选择性预测或并发检索策略是否能有效减少隐私泄露,同时保持高性能?

主要发现

  • 现有多跳检索系统在先检索私有数据再检索公共数据时面临显著的隐私风险,因为私有文档可能在后续的公共检索步骤中被暴露。
  • ConcurrentQA基准表明,最先进的检索模型(包括密集和稀疏方法)在并发公共-私有检索任务上的表现较差,与单一分布设置相比,性能下降最高达75%。
  • 在某些ConcurrentQA问题上,稀疏检索模型(如BM25)的表现优于密集模型,表明在隐私受限环境中,语义匹配并不总是最优方案。
  • 选择性预测通过在涉及私有数据时避免公共检索,显著减少了隐私泄露,但代价是召回率和性能下降。
  • 与顺序检索相比,对多个分布的并发检索在性能和隐私风险方面均有改善,尤其在多跳场景中表现更优。
  • 本研究表明,当前基准无法充分评估公共-私有检索,因此迫切需要像ConcurrentQA这样的新评估框架,以真实反映隐私与性能之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。