[論文レビュー] A large-scale crowdsourced analysis of abuse against women journalists and politicians on Twitter
本稿では、4,537人のボランティアと3人の専門家がラベル付けした275,000件のツイートを含む、きめ細やかに構築されたデータセットを用いて、Twitter上での女性ジャーナリストおよび政治家を標的にしたオンラインいじめについて、大規模かつクラウドソーシングされた分析を提示している。本研究では、特化したいじめ用語埋め込みを微調整したBERTベースのモデルを導入し、有害コンテンツの検出において高い性能を達成しており、オンラインいじめ検出およびソーシャルメディアの安全性に関する研究を促進するため、公開されたデータセットを提供している。
We report the first, to the best of our knowledge, hand-in-hand collaboration between human rights activists and machine learners, leveraging crowd-sourcing to study online abuse against women on Twitter. On a technical front, we carefully curate an unbiased yet low-variance dataset of labeled tweets, analyze it to account for the variability of abuse perception, and establish baselines, preparing it for release to community research efforts. On a social impact front, this study provides the technical backbone for a media campaign aimed at raising public and deciders' awareness and elevating the standards expected from social media companies.
研究の動機と目的
- Twitter上での女性ジャーナリストおよび政治家を標的にしたオンラインいじめの発生頻度と性質を調査すること。
- 大規模なクラウドソーシングを通じて、信頼性が高く、バイアスが少なく、ばらつきの少ないデータセットを構築し、いじめ検出に役立たせること。
- 人間の認知におけるバイアスとばらつきを軽減することに焦点を当て、機械学習を用いた有害コンテンツ検出の技術的基盤を構築すること。
- ソーシャルメディアプラットフォームがオンラインいじめに対するポリシーを改善するよう圧力をかけるメディアキャンペーンを支援すること。
- 自然言語理解における有害コンテンツ検出分野の発展を促進するため、研究コミュニティに高品質でアノテート済みのデータセットを公開すること。
提案手法
- TwitterのFirehoseから、778名の女性ジャーナリストおよび政治家を対象にした220万件のツイートを収集し、層別抽出法を用いて215,000件を選定。さらに、クラスの不均衡を軽減するためにナイーブベイズ分類器を用いて60,000件を拡張。
- Amnesty Decodersを通じて、4,537名のオンラインボランティアが、定義と例を含む複数段階のインターフェースを用いてツイートをラベル付け。ラベルは二値分類(いじめ/問題あり/問題なし)、いじめの種別、および任意のいじめの媒体を含む。
- クラウドソーシングのラベルを検証するため、専門家が568件のツイートをラベル付け。統計的バイアスの制御を維持するために重要度サンプリングを用いた。
- ラベル付け済みデータ上で、事前学習済みBERTエンコーダーと、特化したいじめ用語用語埋め込みを微調整したタスク固有の単語埋め込みを組み合わせたBERTベースの深層学習モデルを訓練。連結された896次元の表現を用いた。
- 重要度サンプリングの重みを調整した90:5:5のトレーニング/バリデーション/テスト分割を用い、確率的勾配降下法と交差エントロピー損失関数を用いて、エンドツーエンドでモデルを訓練。
- ラベル付け者が被害を受けるのを防ぐため、有害コンテンツを分類した後に警告プロンプトを表示するメンタルヘルスの保護措置をシステムに組み込んだ。
実験結果
リサーチクエスチョン
- RQ1Twitter上での女性ジャーナリストおよび政治家を標的にした有害コンテンツの発生頻度とタイプはどのようになっているか?
- RQ2人間のいじめの認識は個人差があるが、そのばらつきはどのように測定され、ラベル付けプロセスでどのように扱われるべきか?
- RQ3リソースが限られ、バイアスが強い環境下でも、特化したいじめ用語埋め込みを微調整したファインチューニング済みBERTモデルは、オンラインいじめを効果的に検出できるか?
- RQ4大規模なクラウドソーシングによるラベル付け作業は、信頼性が高く、バイアスがなく、公開可能なデータセットをどのように生成できるか?
- RQ5このデータセットとモデルは、ソーシャルメディアプラットフォームのオンラインいじめ対策ポリシー改善に、どの程度まで支援できるか?
主な発見
- 4,537人のボランティアが157,000件のユニークなツイートを少なくとも1回ラベル付けし、合計337,000件のラベルが得られた。重要度サンプリングと層別抽出法を用いてバイアスを最小限に抑えることに注力した。
- 275,000件のツイートが3重にラベル付けされ、合意度分析から、特に非テキスト的または曖昧ないじめの分類において、いじめの認識に顕著な差が生じることが判明した。
- BERTベースのモデルは、有害コンテンツ検出において優れた性能を示した。90:5:5の分割で学習した二値分類ヘッドに加え、BERTと特化したいじめ用語埋め込みの組み合わせ表現を微調整した。
- 専門家が568件のツイートをラベル付けし、クラウドソーシングの結果を検証。高リスクのツイートの選択にバイアスが生じる可能性を補正するため、重要度サンプリングを用いた。
- 本研究では、公開されたデータセットとモデルを生成し、今後計画されるメディアキャンペーンの技術的基盤を形成した。
- 大多数のいじめはテキストであり、分類が困難で、その多くが「その他」カテゴリに分類され、いじめのタイプ分類の複雑さが浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。