[論文レビュー] Whose Language Counts as High Quality? Measuring Language Ideologies in Text Data Selection
本論文は、大規模言語モデルの訓練データ選定に用いられる自動テキスト品質フィルタに埋め込まれた言語的イデオロギーを調査する。米国の高校新聞記事から成る全国的データセットにGPT-3の品質フィルタを適用した結果、都市部に位置し、規模が大きく、裕福で、教育水準の高い学校からのテキストが体系的に優遇されていることが判明した。これは、事実の正確性や文学的優位性とは一致しないが、主流的で privileged(特権的)な言語的規範に偏っていることを示している。
Language models increasingly rely on massive web dumps for diverse text data. However, these sources are rife with undesirable content. As such, resources like Wikipedia, books, and newswire often serve as anchors for automatically selecting web text most suitable for language modeling, a process typically referred to as quality filtering. Using a new dataset of U.S. high school newspaper articles -- written by students from across the country -- we investigate whose language is preferred by the quality filter used for GPT-3. We find that newspapers from larger schools, located in wealthier, educated, and urban ZIP codes are more likely to be classified as high quality. We then demonstrate that the filter's measurement of quality is unaligned with other sensible metrics, such as factuality or literary acclaim. We argue that privileging any corpus as high quality entails a language ideology, and more care is needed to construct training corpora for language models, with better transparency and justification for the inclusion or exclusion of various texts.
研究の動機と目的
- 自動的に適用される品質フィルタが、大規模言語モデルの訓練に用いられる際、どの言語的および人口統計的特徴を優遇するかを調査すること。
- GPT-3で用いられている品質フィルタが、事実性、文学的評価、教育水準といった客観的指標と一致するかを評価すること。
- しばしば中立的・技術的であると見なされるデータ選択プロセスに埋め込まれた、暗黙の言語的イデオロギーを露呈すること。
- 偏ったフィルタリング基準が、NLPコーパスにおける代表されないコミュニティの声を系統的に排除していることの顕在化。
- NLP研究におけるデータ選択手順の透明性の向上、意図的なコーパス編集、文書化の促進を提言すること。
提案手法
- 米国各地域の多様な地理的・社会経済的背景を持つ1,000件の米国高校新聞記事を対象に、GPT-3品質フィルタを再現した。
- 新聞記事データセットに米国国勢調査および国立教育統計センターのデータを統合し、著者たちのコミュニティの人口統計的・社会経済的指標と関連づけた。
- 各記事がGPT-3フィルタで「高品質」とラベル付けされるかを予測するためのテキスト分類モデルを訓練・適用した。
- 文の複雑さ、語彙の多様性、トピックの一貫性といった、特定の言語的・スタイル的特徴に対するフィルタの好みを測定した。
- 外部ベンチマークと比較した:ニュースソースの事実性スコア、標準化テストの成績、文学賞の受賞実績。
- 社会言語学的分析を通じて、フィルタの結果と学校規模、郵便番号の収入、教育水準、都市部居住の有無といった人口統計変数との関連を検証した。
実験結果
リサーチクエスチョン
- RQ1GPT-3品質フィルタは、どのような種類の学生が書いたテキストを高品質と分類する傾向があるか?
- RQ2このフィルタの品質評価が、事実の正確性や文学的価値といった客観的指標とどの程度相関しているか?
- RQ3著者たちのコミュニティの人口統計的・社会経済的要因が、フィルタの品質予測とどの程度関連しているか?
- RQ4自動テキストフィルタリングプロセスに埋め込まれた言語的イデオロギーは何か? そして、特定の言語的規範を他の有効な言語的バリエーションよりも優遇する仕組みは?
- RQ5こうしたデータ選択におけるバイアスは、下流のNLPシステムにおける系統的不平等をどのように助長しているか?
主な発見
- GPT-3品質フィルタは、規模が大きく、裕福で、教育水準の高い、都市部に位置する学校からの記事を顕著に優遇している。
- 高所得・高教育水準・都市部に位置する学校の記事は、言語的複雑さを補正した後でも、高品質とされる可能性が著しく高かった。
- フィルタはニュースソースの事実性スコアと有意義な相関を示さず、事実の信頼性を重視していないことが示された。
- 文学的評価や標準化テストの成績とも一致しなかったため、このフィルタは実証的ではない「品質」の概念を測定していることが示された。
- フィルタの好みは、標準的・形式的・学術的指向の書き方を優遇する言語的イデオロギーを反映している。
- 結果として、データコーパス編集は中立的なプロセスではなく、言語的イデオロギーが、どの声が大規模言語モデルに取り入れられるか・排除されるかを形作っていることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。