Skip to main content
QUICK REVIEW

[论文解读] On the Privacy-Utility Tradeoff in Peer-Review Data Analysis

Wenxin Ding, Nihar B. Shah|arXiv (Cornell University)|Jun 29, 2020
Privacy-Preserving Technologies in Data参考文献 43被引用 9
一句话总结

本文提出了一种隐私保护框架,通过利用公开信息对扰动后的数据进行后处理,以发布同行评审数据(如评分分布、校准误差和主观性)——在不损害隐私的前提下提升数据效用。该方法将噪声输出投影到可行值的凸集中,相较于基线方法显著提升了准确性,同时保持差分隐私保证,并在多项式时间内运行。

ABSTRACT

A major impediment to research on improving peer review is the unavailability of peer-review data, since any release of such data must grapple with the sensitivity of the peer review data in terms of protecting identities of reviewers from authors. We posit the need to develop techniques to release peer-review data in a privacy-preserving manner. Identifying this problem, in this paper we propose a framework for privacy-preserving release of certain conference peer-review data -- distributions of ratings, miscalibration, and subjectivity -- with an emphasis on the accuracy (or utility) of the released data. The crux of the framework lies in recognizing that a part of the data pertaining to the reviews is already available in public, and we use this information to post-process the data released by any privacy mechanism in a manner that improves the accuracy (utility) of the data while retaining the privacy guarantees. Our framework works with any privacy-preserving mechanism that operates via releasing perturbed data. We present several positive and negative theoretical results, including a polynomial-time algorithm for improving on the privacy-utility tradeoff.

研究动机与目标

  • 解决同行评审研究中的关键障碍:由于保护评审人身份,缺乏可访问且隐私保护的数据。
  • 设计一种后处理框架,提升扰动后同行评审数据的准确性(效用),而不削弱隐私保证。
  • 确保该方法满足四项关键期望:无效用损失、隐私保护、多项式时间复杂度,以及在可识别情况下实现精确恢复。
  • 实现对同行评审数据的实用、准确分析,以提升科学评估中的公平性与效率。

提出的方法

  • 该框架利用公开信息(如评审人数、论文工作量和评分范围)来约束真实值可能取值的空间。
  • 应用一种多项式时间算法,将任何隐私机制(如拉普拉斯噪声)产生的噪声输出投影到包含所有可行真实评分分布的凸集中。
  • 该凸集施加如下约束:每个评分在 0 到 1 之间,评分总和与总数匹配,且评分单调非减。
  • 该方法避免直接投影到真实值集合上(这可能导致准确性下降),而是采用一种保持隐私并提升效用的松弛方法。
  • 该算法被设计为满足四项期望:无效用损失、无隐私泄露、多项式时间复杂度,以及在可能时实现精确恢复。
  • 通过多种以贝塔分布为模型的评分设定,在差分隐私与拉普拉斯噪声下进行的合成仿真验证了该方法。

实验结果

研究问题

  • RQ1我们能否在不削弱隐私保证的前提下,提升隐私保护型同行评审数据的效用?
  • RQ2如何利用关于同行评审流程的公开结构信息来增强后处理的准确性?
  • RQ3能否设计一种多项式时间算法,在满足严格隐私与准确性约束的前提下,改善隐私-效用权衡?
  • RQ4与直接投影到真实值集合相比,投影到可行值的凸包是否在准确性上表现更优?
  • RQ5在差分隐私下,该框架在估计真实评分分布时,能在多大程度上降低均方误差?

主要发现

  • 所提出的算法在多种模拟场景下(包括贝塔分布评分和不同规模的会议)相比基线方法,实现了数倍的均方误差(MSE)降低。
  • 该方法始终优于原始噪声释放和基线投影方法,即使在高噪声方差(如尺度为 2 的拉普拉斯噪声)下也观察到误差减少。
  • 仿真结果表明,当仅凭公开数据即可精确恢复真实值时,该算法能保持接近零的误差,满足精确恢复的期望。
  • 该框架计算高效,运行在多项式时间内,但对超大规模会议(如 NeurIPS、ICML)的扩展性仍具挑战。
  • 直接投影到真实值集合被证明会降低准确性,凸显了使用凸松弛方法的优势。
  • 该方法具有通用性,可兼容任何对数据进行扰动的隐私机制(包括差分隐私),并可应用于评分分布、校准误差和主观性等场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。