[論文レビュー] ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection
ToxiGenは、13のマイノリティグループに関する274,186件の有毒および健全な発言からなる大規模で機械生成されたデータセットを提供する。このデータセットは、デモベースのプロンプティングフレームワークと、敵対的分類器をループ内に持つデコード手法(Alice)を用いて、繊細で内省的な嫌がらせ表現を生成している。ToxiGenで微調整することで、人間が書いた内省的嫌がらせ表現のデータセットにおける毒性分類器の性能が7–19%向上する。
Toxic language detection systems often falsely flag text that contains minority group mentions as toxic, as those groups are often the targets of online hate. Such over-reliance on spurious correlations also causes systems to struggle with detecting implicitly toxic language. To help mitigate these issues, we create ToxiGen, a new large-scale and machine-generated dataset of 274k toxic and benign statements about 13 minority groups. We develop a demonstration-based prompting framework and an adversarial classifier-in-the-loop decoding method to generate subtly toxic and benign text with a massive pretrained language model. Controlling machine generation in this way allows ToxiGen to cover implicitly toxic text at a larger scale, and about more demographic groups, than previous resources of human-written text. We conduct a human evaluation on a challenging subset of ToxiGen and find that annotators struggle to distinguish machine-generated text from human-written language. We also find that 94.5% of toxic examples are labeled as hate speech by human annotators. Using three publicly-available datasets, we show that finetuning a toxicity classifier on our data improves its performance on human-written data substantially. We also demonstrate that ToxiGen can be used to fight machine-generated toxicity as finetuning improves the classifier significantly on our evaluation subset. Our code and data can be found at https://github.com/microsoft/ToxiGen.
研究の動機と目的
- マイノリティグループの言及に依存しすぎることによる誤検出と、内省的嫌がらせ表現の検出不良を是正するため。
- 代表されないマイノリティグループをカバーし、内省的(スワーリング語を含まない)有害な言語を含む大規模でバランスの取れたデータセットを生成するため。
- 機械生成テキストが人間が書いたテキストと人間の評価において区別できないようにする手法を開発するため。
- 生成データで既存の毒性分類器を微調整し、特に内省的嫌がらせ表現の性能を向上させるため。
提案手法
- GPT-3をテキスト生成器として用い、13のマイノリティグループに関する有毒および健全な発言の生成をデモベースのプロンプティングで制御する。
- Aliceを導入し、ビームサーチ中に特定の毒性レベルに向けた生成を誘導する敵対的分類器をループ内に持つデコードアルゴリズムを実装する。
- 事前学習済みの毒性分類器を用いて生成をガイドし、明確な嫌がらせ語を含まずに高品質かつ的を射た有害なコンテンツを生成する。
- マイノリティグループごとに有毒および健全なサンプルの数を均等に保つように生成を制御し、誤った相関関係を低減する。
- スワーリング語や乱暴な言葉を含まない98.2%の内省的発言(明示的でない)に焦点を当て、繊細で構造的なバイアスを生成する。
- 792件のサブセットについて人間評価を実施し、生成テキストの現実性と区別可能性を検証する。
実験結果
リサーチクエスチョン
- RQ1人間の評価において、機械生成テキストが人間が書いた有毒および健全な発言と区別できないようにできるか?
- RQ2ToxiGenで微調整することで、既存の人工アノテート済み内省的嫌がらせ表現データセットにおける性能はどの程度向上するか?
- RQ3Aliceによる敵対的生成によって、複数の既存の毒性分類器を欺く発言を生成できるか?
- RQ4ToxiGenは、代表されないマイノリティグループおよび内省的嫌がらせ表現の形態をどの程度カバーしているか?
- RQ5ToxiGenで学習させることで、マイノリティグループの言及と毒性予測との間の誤った相関関係はどの程度低減されるか?
主な発見
- 人間評価において、機械生成例の90.5%が人間が書いたテキストと誤認された。これは高い現実性を示している。
- ToxiGenに含まれる有毒例の94.5%が人間のアノテーターによって嫌がらせ発言とラベル付けされた。これは、それらが有害であると認識されていることを確認している。
- 既存の毒性分類器をToxiGenで微調整することで、3つのベンチマークデータセット(ImplicitHateCorpus、SocialBiasFrames、DynaHate)において性能が7–19%向上した。
- このデータセットには98.2%が内省的有害発言を含んでおり、明示的でないが有害な言語の効果的な生成を示している。
- Aliceは、Perspective API や OpenAI のコンテンツフィルタを含む5つの公開済みの毒性分類器を欺く発言を成功裏に生成した。
- この手法により、13のマイノリティアイデンティティグループにわたる、バランスの取れた、多様で文脈的に関連性のある有毒および健全な発言が成功裏に生成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。