Skip to main content
QUICK REVIEW

[論文レビュー] Synthetic Query Generation for Privacy-Preserving Deep Retrieval Systems using Differentially Private Language Models

Aldo Gael Carranza, Rezsa Farahani|arXiv (Cornell University)|May 10, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本論文では、ユーザーのクエリのプライバシーを保証しながら、深層リtrieバルシステムをトレーニングする前に、差分プライバシーを適用した言語モデル(DP-LM)を用いて合成クエリを生成する手法を提案する。元のデータではなく、これらのプライベートな合成クエリを用いてリtrieバルモデルをトレーニングすることで、直接的なDPトレーニングに比べて顕著に優れたリtrieバルパフォーマンスを達成するとともに、強力なクエリレベルのプライバシー保証を維持する。

ABSTRACT

We address the challenge of ensuring differential privacy (DP) guarantees in training deep retrieval systems. Training these systems often involves the use of contrastive-style losses, which are typically non-per-example decomposable, making them difficult to directly DP-train with since common techniques require per-example gradients. To address this issue, we propose an approach that prioritizes ensuring query privacy prior to training a deep retrieval system. Our method employs DP language models (LMs) to generate private synthetic queries representative of the original data. These synthetic queries can be used in downstream retrieval system training without compromising privacy. Our approach demonstrates a significant enhancement in retrieval quality compared to direct DP-training, all while maintaining query-level privacy guarantees. This work highlights the potential of harnessing LMs to overcome limitations in standard DP-training methods.

研究の動機と目的

  • 非例ごとに分解可能な対照的損失(non-per-example decomposable contrastive losses)を用いる深層リtrieバルシステムに差分プライバシー(DP)を適用する課題に対処すること。
  • モデルトレーニングの前段階でプライバシー保護を前もって実施することで、DP制約下でのリtrieバルシステムの有用性を向上させること。
  • DPファインチューニングされた言語モデルが生成する合成データが、プライバシーとリtrieバルパフォーマンスの両面で直接DPトレーニングを上回るかを検証すること。
  • 特に非分解可能な損失を有するシステムにおいて、クエリレベルのプライバシーを維持しつつリtrieバル品質を損なわずに保てるかを示すこと。

提案手法

  • 元のユーザークエリ上で差分プライバシー(DP)を適用してファインチューニングした大規模言語モデル(LM)を用い、プライベートな合成クエリを生成する。
  • DPファインチューニング済みのLMを用いて、元のデータ分布を代表するクエリ-ドキュメントペアの合成データセットを生成する。
  • 下流の深層リtrieバルシステムを、元の機密データではなく、合成データセット上でトレーニングすることで、構造的にクエリレベルのプライバシーを保証する。
  • 事前学習済み言語モデルの一般化能力を活用し、公開知識を組み込むことで、合成データの質と下流モデルの有用性を向上させる。
  • 非分解可能な損失における例ごとの勾配計算に起因する感度の問題を避けるために、合成データ上で標準的な対照的損失トレーニングを実施する。
  • 特に高エプシロン設定下でのDP保証の実証的妥当性を検証するため、キャンアーオープン攻撃を用いてプライバシー漏洩を評価する。
Figure 1: Illustration of approach.
Figure 1: Illustration of approach.

実験結果

リサーチクエスチョン

  • RQ1DPファインチューニングされた言語モデルによる合成クエリ生成は、直接的なDPトレーニングに比べて、より優れたリtrieバルパフォーマンスを達成できるか?
  • RQ2トレーニングの前段階でプライベートな合成クエリを生成することで、非例ごとに分解可能な損失を有するシステムにおいて、強力なクエリレベルのプライバシー保証が可能になるか?
  • RQ3同じプライバシー予算(privacy budget)のもとで、DPによって生成された合成データ上でトレーニングされたリtrieバルモデルの有用性は、直接DP-SGDでトレーニングされたモデルと比べてどの程度高いか?
  • RQ4DPファインチューニングされた言語モデルは、キャンアーオープン攻撃による測定で、どの程度のプライベート情報漏洩を示すか?

主な発見

  • 同じプライバシー予算のもとで、本手法は直接的なDPトレーニングに比べて顕著に優れたリtrieバル品質を達成する。これは、より高品質な合成クエリのおかげである。
  • エプシロン16の条件下で、DPファインチューニング済み言語モデルはキャンアーオープンを防ぎ、エプシロンの下限として約0.015を達成し、強い実証的プライバシー保証を示している。
  • エプシロン16を用いた場合、キャンアーを10回繰り返しても漏洩せず、100回繰り返しても漏洩しなかった。これは、推論攻撃に対して高い耐性を示している。
  • DPを適用しないトレーニングでは高い漏洩が発生した:キャンアーを10回繰り返した場合に67%、100回繰り返した場合に100%が漏洩した。これはDPの必要性を確認する結果である。
  • 本手法は、対照的損失や勾配計算の変更を必要とせず、このようなモデルにおけるDPトレーニングの固有の制限を回避できる。
  • より大きな言語モデルはより高品質な合成クエリを生成するが、計算コストも増加する。したがって、品質と効率のトレードオフが生じる。
Figure 2: Illustration of deep retrieval dual encoder model. Dashed lines connecting the encoders represent a shared encoder.
Figure 2: Illustration of deep retrieval dual encoder model. Dashed lines connecting the encoders represent a shared encoder.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。