[論文レビュー] Mitigating harm in language models with conditional-likelihood filtration
本稿では、研究者が作成したトリガー表現を文書抜粋に付加した際の対数尤度を測定することで、Web規模のデータセットから有害なテキストを検出しフィルタリングする、条件付き尤度フィルタリングという手法を提案する。フィルタリングされたデータで微調整されたモデルは、標準的言語モデル性能にわずかな低下しか生じさせない一方で、毒性が著しく低減されていることが示された。
Language models trained on large-scale unfiltered datasets curated from the open web acquire systemic biases, prejudices, and harmful views from their training data. We present a methodology for programmatically identifying and removing harmful text from web-scale datasets. A pretrained language model is used to calculate the log-likelihood of researcher-written trigger phrases conditioned on a specific document, which is used to identify and filter documents from the dataset. We demonstrate that models trained on this filtered dataset exhibit lower propensity to generate harmful text, with a marginal decrease in performance on standard language modeling benchmarks compared to unfiltered baselines. We provide a partial explanation for this performance gap by surfacing examples of hate speech and other undesirable content from standard language modeling benchmarks. Finally, we discuss the generalization of this method and how trigger phrases which reflect specific values can be used by researchers to build language models which are more closely aligned with their values.
研究の動機と目的
- 大規模かつフィルタリングされていないWebコーパスから有害コンテンツを同定・削除するスケーラブルでプログラム可能な手法を開発すること。
- モデル学習の前に望ましくない学習データをフィルタリングすることで、言語モデルが有害または偏見のあるテキストを生成する傾向を低減すること。
- 価値対応のトリガー表現の条件付き対数尤度に基づくフィルタリングが、最小限のパフォーマンスの妥協を伴いながらも、より安全なモデルを実現できることを示すこと。
- lm1b のような広く使われている言語モデルベンチマークに、有害なコンテンツが存在することを露呈し、それが毒物生成を間接的に促進する可能性があること。
- 研究者がデータセットのキュレーションに合わせてカスタムのトリガー表現を定義することで、特定の倫理的価値に言語モデルを整合させることを可能にすること。
提案手法
- 事前学習済み言語モデルが、Web規模コーパス内の各文書抜粋に続く人間が作成したトリガー表現(例:「ソーシャル・ジャスティス・ワーカーは白人種を憎む。」)の条件付き対数尤度を計算する。
- 文書の条件付き対数尤度が高ければ、有害なイデオロギーと整合していると判断され、その文書はフィルタリング対象となる。
- 15億パラメータのデコーダー専用Transformerアーキテクチャを採用し、C4および独自のWebクロールデータから得られたフィルタリング済みデータセットで微調整する。
- 白人至上主義や障害差別主義など、特定の有害なイデオロギーを表すように手作業でトリガー表現を設計し、価値に合わないコンテンツを標的とする。
- 本手法は汎用的であり、毒性の進化に応じて新たなトリガー表現を繰り返し適用可能である。
- 本手法は、特定のブロックリストと組み合わせることで、説明的文脈や反対意見の提示文脈を保持しつつ、有害コンテンツのみを削除できる。
実験結果
リサーチクエスチョン
- RQ1研究者が作成したトリガー表現の条件付き尤度が、Web規模コーパスにおける有害ドキュメントを効果的に同定できるか?
- RQ2本手法でフィルタリングされたデータセットを用いることで、推論段階における毒性の低いテキスト生成が可能になるか?
- RQ3フィルタリング後の言語モデル性能の妥協度は、標準的言語モデルベンチマークと比較してどの程度か?
- RQ4lm1b などの既存の言語モデルベンチマークには、モデル行動に偏見をもたらす可能性のある有害なコンテンツがどの程度含まれているか?
- RQ5異なるトリガー表現を用いることで、本手法が多様な倫理的価値に言語モデルを整合させるために一般化可能か?
主な発見
- フィルタリング済みデータセットで学習されたモデルは、Perspective APIによる評価で最大毒性が著しく低減されており、本手法の有効性が裏付けられた。
- 標準的言語モデルベンチマークでのパフォーマンス低下はわずかであり、毒性低減が主要な生成能力の損失を伴わないことを示している。
- 人間によるアノテーション評価により、本手法が一貫して価値に合わない、有毒または有害なコンテンツを同定していることが確認された。
- 本研究では、lm1b などの標準ベンチマークに、差別的・憎悪的言語の例が含まれていることが判明し、それがモデル行動に偏見をもたらす可能性があることを示唆した。
- 本手法により、研究者がカスタムのトリガー表現を定義・適用でき、特定の倫理的または社会的原則に基づいた価値対応のモデル学習が可能になった。
- ユニバーサル adversarial 攻撃手法を用いて生成された攻撃的トリガーは、有害コンテンツを効果的に抽出できなかったため、このような手法をトリガー生成に用いるには限界があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。