Skip to main content
QUICK REVIEW

[論文レビュー] Position: Considerations for Differentially Private Learning with Large-Scale Public Pretraining

Florian Tramèr, Gautam Kamath|arXiv (Cornell University)|Dec 13, 2022
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

この論文は、微分プライバシー機械学習における大規模な公開Webスクレイピングデータセットを用いた事前学習の使用を批判し、こうした事前学習がプライバシー主張を損なうおそれがあり、感受性の高い分野では有用性の向上にも寄与しない可能性があると主張する。公開データがプライバシー中立的であるという仮定に疑問を呈し、より責任あるデータ実践、より良いベンチマーク、モデルレベルの微分プライバシーを超えた包括的なプライバシー配慮の必要性を提起する。

ABSTRACT

The performance of differentially private machine learning can be boosted significantly by leveraging the transfer learning capabilities of non-private models pretrained on large public datasets. We critically review this approach. We primarily question whether the use of large Web-scraped datasets should be viewed as differential-privacy-preserving. We caution that publicizing these models pretrained on Web data as "private" could lead to harm and erode the public's trust in differential privacy as a meaningful definition of privacy. Beyond the privacy considerations of using public data, we further question the utility of this paradigm. We scrutinize whether existing machine learning benchmarks are appropriate for measuring the ability of pretrained models to generalize to sensitive domains, which may be poorly represented in public Web data. Finally, we notice that pretraining has been especially impactful for the largest available models -- models sufficiently large to prohibit end users running them on their own devices. Thus, deploying such models today could be a net loss for privacy, as it would require (private) data to be outsourced to a more compute-powerful third party. We conclude by discussing potential paths forward for the field of private learning, as public pretraining becomes more popular and powerful.

研究の動機と目的

  • 微分プライバシー学習において、Webデータを公開して事前学習することのプライバシー中立的であるという仮定に反論すること。
  • 現在のベンチマークが感受性の高い現実世界の分野におけるプライベートモデルの有用性を的確に反映しているかどうかに疑問を呈すること。
  • 大規模なプライベートモデルを第三者のインfraストラクチャにデプロイすることで、データアウトソーシングに起因してプライバシーリスクが増加する可能性があることを強調すること。
  • 特にインターネット由来のトレーニングデータに関して、粒度の細かいプライバシー配慮を促すこと。
  • 標準的なMLベンチマークではなく、現実のプライバシー感受性タスクを反映した、より良いベンチマークの必要性を訴えること。

提案手法

  • Webスクレイピングデータセットを事前学習に使用する際のプライバシー的影響を分析し、特にそのデータに感受性の高い情報が含まれる可能性がある点に注目する。
  • 微分プライバシー学習の評価に標準的なMLベンチマーク(例:ImageNet、GLUE)を使用することの批判を行い、これらが現実世界のプライバシー制約を十分に捉えていないと主張する。
  • 将来的なファウンデーションモデルが、同意メカニズムやデータソースレベルでのDPなど、明示的なプライバシー保護措置を伴って事前学習されるべきだと提言する。
  • データが過小代表化されたり、極めて感受性の高い分野を反映した、新たなベンチマークの開発を提案する。
  • モデル中心のプライバシー研究から、データ収集、データライフタイム、モデルデプロイメントの実践を含む包括的プライバシー研究へのシフトを提唱する。

実験結果

リサーチクエスチョン

  • RQ1Webスクレイピングデータを大規模に事前学習することで、感受性のあるコンテンツの記憶が生じる可能性があることを踏まえ、それが微分プライバシーと真正に整合するのか?
  • RQ2現在のプライベート学習のベンチマークは、感受性の高い分野にモデルをデプロイする際の真の課題をどの程度反映しているのか?
  • RQ3第三者のインフラに大規模なモデルをデプロイする際、Webデータを用いた公開事前学習が、ネットプライバシー損失をもたらす可能性はあるか?
  • RQ4二元的分類(公開対非公開)を超えて、インターネット由来のトレーニングデータに対して粒度の細かいプライバシー基準をどのように確立できるか?
  • RQ5明示的にラベル付けされていなくても、個人を特定できる情報や感受性の高い情報が含まれる可能性のあるデータを用いて大規模モデルを事前学習することは、どのような影響を及ぼすのか?

主な発見

  • Webスクレイピングデータを用いた事前学習は、感受性の高い情報や個人を特定できる情報が含まれる可能性があるため、プライバシーが保証されるとは限らない。こうした情報は記憶され、再出力される可能性がある。
  • ImageNet や GLUE といった標準ベンチマークの使用は、公開事前学習によって「無料で」プライベートに解ける可能性があるため、プライベート学習における進展の誤った感覚を与えるおそれがある。
  • 強力なDP保証(例:ε=1)が与えられても、公開事前学習後にプライベートデータでファインチューニングされたモデルは、事前学習データ自体がプライバシー配慮のないものである限り、依然としてプライバシーリスクを有する可能性がある。
  • 現在のパラダイムは、ユーザーが計算能力に優位な第三者に自身のプライベートデータをアウトソーシングする必要があるため、ネットプライバシー損失をもたらす可能性がある。
  • 現実世界のプライバシー感受性タスクとよく相関する、信頼性のあるプライベート学習用ベンチマークは現在存在せず、これが進捥の測定を困難にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。