[論文レビュー] Detecting Harmful Online Conversational Content towards LGBTQIA+ Individuals
本論文は、LGBTQIA+に対する攻撃的で有害な会話的コンテンツを検出するための新しいマルチラベルデータセットを紹介する。本研究では、従来の機械学習(SVM、ロジスティック回帰)とファインチューニングされた大規模言語モデル(BERT、RoBERTa、HateBERT)を用いて、6つの有害な言語のカテゴリを分類する。結果として、BERTはほとんどのラベルでF1スコアが≥0.82を達成しており、低リソースの脅しラベルの課題があるものの、LGBTQIA+に対する攻撃的で有害な言語の識別において優れた性能を示している。
Online discussions, panels, talk page edits, etc., often contain harmful conversational content i.e., hate speech, death threats and offensive language, especially towards certain demographic groups. For example, individuals who identify as members of the LGBTQIA+ community and/or BIPOC (Black, Indigenous, People of Color) are at higher risk for abuse and harassment online. In this work, we first introduce a real-world dataset that will enable us to study and understand harmful online conversational content. Then, we conduct several exploratory data analysis experiments to gain deeper insights from the dataset. We later describe our approach for detecting harmful online Anti-LGBTQIA+ conversational content, and finally, we implement two baseline machine learning models (i.e., Support Vector Machine and Logistic Regression), and fine-tune 3 pre-trained large language models (BERT, RoBERTa, and HateBERT). Our findings verify that large language models can achieve very promising performance on detecting online Anti-LGBTQIA+ conversational content detection tasks.
研究の動機と目的
- オンラインプラットフォーム(特にRedditなど)におけるLGBTQIA+に対する嫌がらせ、攻撃的発言、差別的言語の増加に伴い、それらを自動検出する仕組みを提供すること。
- LGBTQIA+個人を標的とした6つの異なる有害性カテゴリに分類可能な、高品質なマルチラベルデータセットを構築すること。
- 従来の機械学習モデルとファインチューニングされた大規模言語モデルの両方が、LGBTQIA+を標的とした会話的有害性を検出する効果性を評価すること。
- 今後の共同タスクや倫理的なAIのコンテンツモデレーションへの応用を支援し、より安全で包摂的なオンライン環境の実現を図ること。
提案手法
- RedditBiasの性別的指向次元を改変し、LGBTQIA+を標的とした6つの異なる有害な言語カテゴリ(有害性、深刻な有害性、不適切な表現、脅し、中傷、アイデンティティ攻撃)に沿ってコメントを分類・ラベル付けした。
- 性的・ステレオタイプ的・攻撃的な内容を含む感受性の高いコンテンツのラベル付けにおける品質と信頼性を確保するため、アノテーターの人的評価を実施した。
- 有害なコンテンツの二値分類およびマルチラベル分類の両方を想定し、2つのベースライン機械学習モデル(サポートベクターマシン(SVM)、ロジスティック回帰)を実装した。
- 本データセット上でファインチューニングした3つの事前学習済み大規模言語モデル(BERT、RoBERTa、HateBERT)を用い、LGBTQIA+への攻撃的な感情や言語の検出性能を評価した。
- データセット全体の整合性を保証するため、人為的ラベルと照合する目的で、Detoxifyを用いた自動ラベリングを実施した。
- 今後の研究や共同タスクを支援する目的で、完全なマルチラベルデータセットとコードを公開した。
実験結果
リサーチクエスチョン
- RQ1マルチラベルデータセットは、アイデンティティ攻撃、脅し、差別的ステレオタイプといった、LGBTQIA+に対する有害な言語の洗練された形を的確に捉えることができるか?
- RQ2従来の機械学習モデルとファインチューニングされた大規模言語モデルは、LGBTQIA+を標的とした会話的有害性の検出において、どのように性能を発揮するか?
- RQ3BERT や HateBERT といった事前学習済み言語モデルは、微妙なまたは文脈依存的なLGBTQIA+に対する差別的スラングやマイクロアグレッションをどの程度一般化して検出できるか?
- RQ4データセット内のラベルの不均衡の影響により、低リソースのラベル(例:「脅し」)を検出する際の性能の妥当性はどの程度か?
主な発見
- BERTは「脅し」ラベルを除くすべてのラベルでF1スコアが少なくとも0.82を達成しており、LGBTQIA+に対する有害な言語の検出において優れた性能を示している。
- HateBERTは、嫌がらせ発言の検出を目的として事前学習されたにもかかわらず、BERTに比べて性能が低く、一般向けの大規模言語モデル(LLM)がこのタスクにおいてより効果的である可能性を示している。
- データセットの分析から、アイデンティティ攻撃と中傷が最も頻度の高い有害なカテゴリであり、Redditの例から高い有害性スコアが得られた。
- 「脅し」ラベルはサンプル数が最も少なく、すべてのモデルでF1スコアが最低にとどまり、データの不均衡が主な課題であることが明らかになった。
- 人為的ラベル付けの結果は高い一貫性を示しており、今後の共同タスクやモデル評価におけるデータセットの信頼性が裏付けられた。
- 本研究は、大規模言語モデルを適切にファインチューニングすることで、LGBTQIA+を標的とした会話的コンテンツの検出が、高い正確性と再現率で実現可能であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。