Skip to main content
QUICK REVIEW

[論文レビュー] Data Portraits: Recording Foundation Model Training Data

Marc Marone, Benjamin Van Durme|arXiv (Cornell University)|Mar 6, 2023
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、ストライドドブルームフィルターベースの軽量で確率的データ構造であるData Portraitsを紹介する。これにより、基盤モデルの学習データに対する高速かつ空間効率的なメンバーシップインファレンスが可能になる。元のデータセットサイズのわずか3%のストレージで、特定のテキストスニペットが学習コーパスに含まれていたかどうかを特定できる。これは、テストセットの漏洩やモデルの改ざんを低誤検出率で効果的に検出可能である。

ABSTRACT

Foundation models are trained on increasingly immense and opaque datasets. Even while these models are now key in AI system building, it can be difficult to answer the straightforward question: has the model already encountered a given example during training? We therefore propose a widespread adoption of Data Portraits: artifacts that record training data and allow for downstream inspection. First we outline the properties of such an artifact and discuss how existing solutions can be used to increase transparency. We then propose and implement a solution based on data sketching, stressing fast and space efficient querying. Using our tools, we document a popular language modeling corpus (The Pile) and a recently released code modeling dataset (The Stack). We show that our solution enables answering questions about test set leakage and model plagiarism. Our tool is lightweight and fast, costing only 3% of the dataset size in overhead. We release a live interface of our tools at https://dataportraits.org/ and call on dataset and model creators to release Data Portraits as a complement to current documentation practices.

研究の動機と目的

  • 特定のテキストが基盤モデルの学習データに含まれていたかどうかを判断するための実用的ツールの不足に対処すること。
  • メンバーシップインファレンスを支援する新しいドキュメンテーションアーティファクト「Data Portraits」を導入することで、AIモデル開発の透明性を向上させること。
  • 従来のドキュメンテーション慣習(例:Datasheets や Model Cards)を補完する、軽量でスケーラブルなデータセット検査ソリューションを提供すること。
  • コンテンツ作成者、科学者、エンドユーザーが、大規模言語モデルにおけるデータ漏洩、改ざん、記憶行動を検出できるようにすること。
  • データセットおよびモデル作成者によるData Portraitsの広範な採用を推進し、標準的手順とするように提言すること。

提案手法

  • 本手法はストライドドブルームフィルタを採用する。これは、複数のハッシュ関数を用いて学習データを空間的に効率的に表現する、圧縮された確率的データ構造である。
  • 各テキスト例は固定長のn-gram(例:50文字)に分割され、ハッシュ化されてブルームフィルタに格納され、高速なメンバーシップクエリが可能になる。
  • システムはミリ秒未塔の遅延でクエリを処理でき、元のデータセットサイズに対してわずか約3%のストレージオーバーヘッドに抑えられる。
  • 誤検出率は構築時において調整可能であり、精度とストレージコストのトレードオフを可能にする。
  • 本手法は完全なデータ再配布を回避し、元のデータセットを露呈せずに、ローカルかつオフラインでのメンバーシップテストを可能にする。
  • 実装はThe PileおよびThe Stackデータセット上で検証され、ライブWebインターフェースはdataportraits.orgで利用可能である。

実験結果

リサーチクエスチョン

  • RQ1軽量で効率的なデータ構造を用いて、この例が学習データに含まれていたかどうかを特定するメンバーシップクエリに応えることは可能か?
  • RQ2ブルームフィルタのような確率的データ構造が、大規模なウェブスクリーピングデータセットに対して、正確かつスケーラブルなメンバーシップインファレンスをどの程度サポートできるか?
  • RQ3速度、正確性、リソース使用量の観点から、ストライドドブルームフィルタの性能は、フルテキストインデキシングやgrepベースのアプローチと比べてどうか?
  • RQ4実世界の言語モデル学習データセット(例:The Pile や The Stack)に適用した場合、このシステムの誤検出率はどの程度か?
  • RQ5Data Portraitsは実際の場面でテストセットの漏洩やモデルの改ざんを効果的に検出できるか?

主な発見

  • ストライドドブルームフィルタの実装は、1クエリあたり1ミリ秒未塔でメンバーシップインファレンスを達成し、ストレージオーバーヘッドは元のデータセットサイズのわずか3%である。
  • システムの誤検出率は7×10⁻⁴であり、意図した1×10⁻³をわずかに下回っており、実用的な用途において高い正確性を示している。
  • フルテキストインデキシング(例:FTS)と比較すると、200文字のコンテキストでは約700倍高速であるが、短いコンテキストでは再現率と正確性が低くなる。
  • 本手法は、新規入力と学習データとの間で重複するテキストスパン(例:'National Counterintelligence and Security Center'など長文の一致)を効果的に検出可能である。
  • ツールはテストセットの漏洩やモデルの改ざん検出を可能にし、The PileおよびThe Stackデータセットを用いた事例研究でその有効性が実証された。
  • システムは近似的なメンバーシップテストとドキュメントのフィンガープリント生成の両方をサポートしており、誤検出率およびn-gram長さのパラメータによるパフォーマンスの調整が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。