Skip to main content
QUICK REVIEW

[論文レビュー] Pile of Law: Learning Responsible Data Filtering from the Law and a 256GB Open-Source Legal Dataset

Peter Henderson, Mark Krass|arXiv (Cornell University)|Jul 1, 2022
Artificial Intelligence in Law被引用数 44
ひとこと要約

この論文は Pile of Law を紹介します。約256GB のオープンソース法学データセットで、法に基づくデータフィルタリングを研究し、これからの責任ある LLM の事前学習を指針とするために、文脈的なプライバシーと毒性フィルターを学習する方法を示します。

ABSTRACT

One concern with the rise of large language models lies with their potential for significant harm, particularly from pretraining on biased, obscene, copyrighted, and private information. Emerging ethical approaches have attempted to filter pretraining material, but such approaches have been ad hoc and failed to take context into account. We offer an approach to filtering grounded in law, which has directly addressed the tradeoffs in filtering material. First, we gather and make available the Pile of Law, a 256GB (and growing) dataset of open-source English-language legal and administrative data, covering court opinions, contracts, administrative rules, and legislative records. Pretraining on the Pile of Law may help with legal tasks that have the promise to improve access to justice. Second, we distill the legal norms that governments have developed to constrain the inclusion of toxic or private content into actionable lessons for researchers and discuss how our dataset reflects these norms. Third, we show how the Pile of Law offers researchers the opportunity to learn such filtering rules directly from the data, providing an exciting new research direction in model-based processing.

研究の動機と目的

  • 法的・行政データの約256GB規模のデータセット(Pile of Law)を収集しオープンソース化して、データサニタイズ規範を研究する。
  • 政府の法令が、モデルの事前学習で使用されるデータのプライバシーと毒性の制約をどう形作るかを整理する。
  • 法的データから黙示的なサニタイズ規則を学習してフィルタリングを指導できることを示す。
  • 法的規範から文脈的なプライバシーと毒性基準を学ぶための実践的洞察とフレームワークを提供する。

提案手法

  • 裁判所の意見、契約、法令、規制、政府公表物など35の情報源からデータを収集する。
  • 米国の法制度と付録に根ざすプライバシーと毒性フィルタリング規範を特徴づけ、議論する。
  • Pile of Law 上で初期の BERT-large 相当モデルを訓練し、ベースライン結果を報告する(Appendix F)。
  • データセットから文脈的プライバシー規則(例:偽名化の判断)を推定するケーススタディと学習手法を開発する。
  • モデル間および時系列での毒性フィルタリングを評価し、合意/不一致と文脈要因を強調する(Appendix)。
  • 黙示的サニタイズ規則を学習して法的編集(赤字化)機構を模倣する方法を示す。

実験結果

リサーチクエスチョン

  • RQ1法的規範は大規模言語モデルの事前学習におけるデータサニタイズの実践をどう導くことができるか。
  • RQ2文脈的・法域別のプライバシー規則は直接Pile of Lawデータセットから学習できるか。
  • RQ3毒性の定義とフィルタは、時間と文脈を通じて法的規範とどのように整合するか。
  • RQ4法的テキストに適用された既存の毒性フィルタの限界は何か、そして法的データから学ぶことでそれらをどう解決できるか。

主な発見

  • 著者らは35ソースからの法的・行政データの約256GBデータセットを収集しオープンソース化して、データフィルタリング規範を研究します。
  • Pile of Law での事前学習は難解な法的タスクに役立ち、非常に文脈依存的なモデルと同程度の結果をもたらす可能性がある(Appendix F)。
  • Pile of Law は法域や文脈によって異なるプライバシーと毒性の規範をエンコードしており、文脈的なプライバシー規則(例:偽名化)や文脈的な毒性配慮の学習を可能にする。
  • 毒性フィルターはモデル間の不一致と内容長さ・文脈への感度を示し、より堅牢で価値観に合わせたフィルタリング手法の必要性を示唆する。
  • このデータセットは文脈認識型のフィルタリングルールを学習し、法的規範との整合性を測定する能力を提供し、現行のサニタイズ技術の欠点を浮き彫りにして、今後の研究を指向する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。