Skip to main content
QUICK REVIEW

[論文レビュー] I Am Not What I Write: Privacy Preserving Text Representation Learning

Ghazaleh Beigi, Kai Shu|arXiv (Cornell University)|Jul 6, 2019
Privacy-Preserving Technologies in Data参考文献 44被引用数 18
ひとこと要約

この論文では、同時に微分プライバシーを保証し、個人情報を隠蔽し、下流のNLPタスクにおける高い有用性を維持するプライバシー保護型テキスト表現を学習するための新しいフレームワーク、DPTextを提案する。自己符号化器と微分プライバシーを適用したノイズ、意味的特徴識別器、および個人属性識別器を組み合わせることで、DPTextは再識別リスクと個人情報漏洩リスクを効果的に低減しながら、意味的意味を保持する。この有効性は、感情分析および品詞タグ付けタスクで検証された。

ABSTRACT

Online users generate tremendous amounts of textual information by participating in different activities, such as writing reviews and sharing tweets. This textual data provides opportunities for researchers and business partners to study and understand individuals. However, this user-generated textual data not only can reveal the identity of the user but also may contain individual's private information (e.g., age, location, gender). Hence, "you are what you write" as the saying goes. Publishing the textual data thus compromises the privacy of individuals who provided it. The need arises for data publishers to protect people's privacy by anonymizing the data before publishing it. It is challenging to design effective anonymization techniques for textual information which minimizes the chances of re-identification and does not contain users' sensitive information (high privacy) while retaining the semantic meaning of the data for given tasks (high utility). In this paper, we study this problem and propose a novel double privacy preserving text representation learning framework, DPText, which learns a textual representation that (1) is differentially private, (2) does not contain private information and (3) retains high utility for the given task. Evaluating on two natural language processing tasks, i.e., sentiment analysis and part of speech tagging, we show the effectiveness of this approach in terms of preserving both privacy and utility.

研究の動機と目的

  • ユーザー生成テキストデータに含まれる個人情報や感受性の高い属性が露わになる問題に対処すること。
  • 下流のNLPタスクにおける意味的有用性を保ちながら、再識別および属性推定リスクを最小限に抑える手法を設計すること。
  • PIIの削除、k-匿名性、標準的な微分プライバシーといった従来の技術には、潜在表現に対する推定攻撃を防げないという限界があるため、それらを克服すること。
  • 微分プライバシーと表現学習を統合する包括的なフレームワークを構築し、プライバシー保護と有用性の両立を図ること。
  • 学習されたテキスト表現が意味的に意味を持つだけでなく、個人属性の推定や再識別に対して耐性を持つことを保証すること。

提案手法

  • フレームワークは、生テキスト入力を元に圧縮された低次元表現を学習するための自己符号化器を採用する。
  • 微分プライバシーは、潜在表現にラプラスノイズを追加することで実装され、個々のデータポイントが再識別できないことを保証する。
  • 意味的意味識別器を訓練して、元のテキストの意味的コンテンツを維持し、下流タスクにおける有用性を保証する。
  • 個人属性識別器を用いて、モデルが表現から感受性のある属性(例:年齢、性別、健康状態)を推定する能力を最小限に抑える。
  • モデルは敵対的訓練を用いてエンドツーエンドで訓練される:自己符号化器は、個人属性識別器をだませるような表現を生成するが、同時に意味的識別器と微分プライバシー制約を満たす。
  • フレームワークは初期表現モデルに依存しないため、doc2vecなどの既存手法との統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1テキスト表現学習フレームワークは、微分プライバシーの確保、個人属性の隠蔽、意味的有用性の維持を同時に達成できるか?
  • RQ2提案されたフレームワークは、個々のテキスト表現の再識別リスクをどの程度低減できるか?
  • RQ3学習された表現から性別、年齢、医療状態などの個人属性を推定するリスクは、どの程度低減されるか?
  • RQ4実世界のNLPタスクにおいて、従来手法と比較して、有用性とプライバシー保護の両面で優れているか?
  • RQ5意味的特徴識別器と個人属性識別器の統合は、標準的な微分プライバシーや単独の敵対的訓練と比較して、プライバシーと有用性のトレードオフを改善するか?

主な発見

  • DPTextは、潜在空間にラプラスノイズを注入することで微分プライバシーを強制することにより、個々のテキスト表現の再識別リスクを顕著に低減した。
  • 個人属性識別器が学習された表現から感受性のある属性を正確に予測できないことから、フレームワークが個人属性情報の隠蔽に成功したことが実証された。
  • 感情分析や品詞タグ付けなどの下流タスクで優れた性能を示したことから、元のテキストの意味的意味が良好に保持されていることが裏付けられた。
  • PIIの削除や標準的な微分プライバシーに依存する先行手法とは異なり、DPTextは潜在表現からの推定攻撃に対しても保護を提供するため、優れた性能を示した。
  • 二重識別器を備えた敵対的訓練の設定により、意味的忠実度と個人属性漏洩の両方を明示的にモデル化する従来のアプローチよりも、より優れたプライバシーと有用性のトレードオフが達成された。
  • フレームワークは、特定の事前学習表現モデルに依存しないため、汎用的かつ頑健であり、既存のテキスト埋め込み技術と統合可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。