[論文レビュー] Automated Detection of GDPR Disclosure Requirements in Privacy Policies using Deep Active Learning
本論文では、18のGDPR開示要件に従って、深層学習を用いたアクティブラーニング手法を提案し、プライバシーポリシーを自動的に分類する。新たに作成された1,080件のアノテート済みプライバシーポリシーを用いて訓練されたモデルは、89.2%の正確性を達成し、2018年からの施行以降、わずか3%のウェブサイトがGDPR開示要件を完全に遵守していることが判明した。
Since GDPR came into force in May 2018, companies have worked on their data practices to comply with this privacy law. In particular, since the privacy policy is the essential communication channel for users to understand and control their privacy, many companies updated their privacy policies after GDPR was enforced. However, most privacy policies are verbose, full of jargon, and vaguely describe companies' data practices and users' rights. Therefore, it is unclear if they comply with GDPR. In this paper, we create a privacy policy dataset of 1,080 websites labeled with the 18 GDPR requirements and develop a Convolutional Neural Network (CNN) based model which can classify the privacy policies with an accuracy of 89.2%. We apply our model to perform a measurement on the compliance in the privacy policies. Our results show that even after GDPR went into effect, 97% of websites still fail to comply with at least one requirement of GDPR.
研究の動機と目的
- 2018年のGDPR施行後、主要ウェブサイトのプライバシーポリシーがGDPR開示要件をどの程度遵守しているかを調査すること。
- プライバシーポリシー分析のための、GDPR要件でラベル付けされた公開可能で高品質なデータセットの不足に対処すること。
- プライバシーポリシーのセグメントを特定のGDPR開示カテゴリに自動的に分類する、スケーラブルな方法を開発すること。
- プールベースのアクティブラーニングを用いて、ラベル付け作業の負荷を最小限に抑えつつ、モデルの正確性を費用対効果よく向上させること。
- 上位9,761のウェブサイトにおけるプライバシーポリシーのGDPR準拠状況に関する実証的証拠を提供すること。
提案手法
- 地理的多様性とデータの一貫性を確保するため、イギリスを拠点とするVPNを用いて、9,761のウェブサイトのプライバシーポリシー語彙を構築した。
- 法的専門家の協議を通じて18のGDPR開示要件を特定し、アノテーション用の18個のバイナリラベルとして使用した。
- 訓練済みの人的アノテーターを用いて1,080件のプライバシーポリシーをアノテートし、モデルの学習に適した高品質なラベル付きデータセットを構築した。
- プライバシーポリシーのセグメントを18のGDPR要件カテゴリにマップするCNNベースのテキスト分類モデルを開発した。
- プールベースのアクティブラーニングを適用し、反復的に情報量の多い未ラベル付きサンプルを選択することで、最小限のラベル付け作業でモデルの正確性を向上させた。
- 最終的なモデルを用いて、9,761のウェブサイト全体にわたる大規模な準拠測定を実施し、各GDPR要件ごとの準拠状況を評価した。
実験結果
リサーチクエスチョン
- RQ1GDPRが2018年に施行されてから、上位ウェブサイトのプライバシーポリシーが18のGDPR開示要件をどの程度遵守しているか。
- RQ2CNNベースのモデルは、プライバシーポリシーのセグメントを特定のGDPR開示カテゴリに分類する際にどの程度有効であるか。
- RQ3アクティブラーニングは、ラベル付けコストを最小限に抑えながら、GDPR準拠分類器の性能を顕著に向上させることができるか。
- RQ4どのGDPR開示要件がプライバシーポリシーで最も頻繁に欠落しているか。各要件の準拠率はどの程度か。
- RQ5ウェブサイト全体における準拠レベルの分布はどのようになっており、全18要件を満たす完全準拠のウェブサイトはどれくらいあるか。
主な発見
- CNNベースのモデルは89.2%の正確性と平均F1スコア0.88を達成し、アクティブラーニングによる改善で初期モデル比で10.8%の相対的向上を示した。
- 全18のGDPR開示要件を完全に遵守しているウェブサイトはわずか3%であり、広範な非遵守状況が示された。
- プロファイリングや自動意思決定に関する6つの主要なGDPR要件カテゴリは、プライバシーポリシーに15.3%〜20%の割合でしか開示されていなかった。
- プロファイリングまたは自動意思決定に関する情報開示が最も頻繁に欠落しており、わずか15.3%のウェブサイトでのみ開示されていた。
- 全97%のウェブサイトが少なくとも1つのGDPR開示要件を満たしていないことから、プライバシーポリシーの透明性に深刻な欠陥があることが浮き彫りになった。
- 本研究では、GDPRの法的要件と実際のプライバシーポリシー開示との間には顕著なギャップが存在することが明らかになった。このギャップは、施行から数年経った現在でも依然として存在している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。