[論文レビュー] SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification
本論文は、OLIDデータセットをシードとして用い、アンサンブル半教師あり学習を適用してカバー範囲を拡大することで、900万件の英語ツイートから構成される大規模な半教師あり学習データセットSOLIDを紹介する。SOLIDでモデルをファインチューニングし、OLIDで評価した場合、特に下位の分類階層で顕著な性能向上を達成しており、リソースが限られた攻撃的言語検出タスクにおける有効性を示している。
The widespread use of offensive content in social media has led to an abundance of research in detecting language such as hate speech, cyberbullying, and cyber-aggression. Recent work presented the OLID dataset, which follows a taxonomy for offensive language identification that provides meaningful information for understanding the type and the target of offensive messages. However, it is limited in size and it might be biased towards offensive language as it was collected using keywords. In this work, we present SOLID, an expanded dataset, where the tweets were collected in a more principled manner. SOLID contains over nine million English tweets labeled in a semi-supervised fashion. We demonstrate that using SOLID along with OLID yields sizable performance gains on the OLID test set for two different models, especially for the lower levels of the taxonomy.
研究の動機と目的
- 特に階層的分類階層の下位レベルにおいて、ラベル付きの攻撃的言語データが不足している問題に対処するため。
- 高価な手動ラベリングに依存せずに、スケーラブルでコスト効率の良い方法で大規模な攻撃的言語データを収集するため。
- 特に暗黙的または繊細な攻撃的コンテンツに対して、性能向上を支援する公開可能な大規模データセットを提供するため。
- 頻出ストップワードをクエリ用語として用い、多様なインダクティブバイアスを持つアンサンブルモデルを採用することで、データ収集におけるバイアスを軽減するため。
- より大規模で代表的な訓練分布を提供することで、攻撃的言語検出システムの一般化性能とロバスト性を向上させるため。
提案手法
- 著者らは、半教師あり学習のシードとしてOLIDデータセットを用い、訓練データを拡張するためのマルチステージパイプラインを適用する。
- 自然言語使用の広範かつ代表的なカバーを確保するため、頻出ストップワードをクエリ用語としてツイートを収集する。
- 多様な事前学習済み言語モデルのアンサンブルを、OLIDのシードデータ上で訓練し、数百万件のラベルなしツイートのラベル予測に用いる。
- 信頼度のしきい値とコンSENSUS投票を用いて、モデルの予測をフィルタリング・集約することで、ノイズとバイアスを低減する。
- 最終的なデータセットSOLIDには、3段階の階層ラベル(攻撃的検出、タイプ分類、標的特定)を備えた900万件の英語ツイートが含まれる。
- SOLIDでファインチューニングしたモデルとOLID単体でファインチューニングしたモデルの、OLIDテストセットにおける性能を比較することで、半教師ありラベルの品質を検証する。
実験結果
リサーチクエスチョン
- RQ1訓練データが限られている状況で、半教師あり学習が攻撃的言語検出の性能を顕著に向上させることができるか?
- RQ2シードデータセットとモデルアンサンブルを用いて訓練データを拡張することで、特にリソースが限られた分類階層において、より良い一般化性能が得られるか?
- RQ3半教師ありラベルの品質は、ゴールドスタンダードのアノテーションと比較して、モデル性能とバイアス低減の観点で優れているか?
- RQ4SOLIDのような大規模データセットは、より小さな手動で整備されたデータセットと比較して、暗黙的攻撃的コンテンツ(例:皮肉、コード化されたスラング)の検出を改善できるか?
- RQ5初期クエリ用語の選択(例:ストップワード vs. キーワード)が、得られるデータセットの代表性とバイアスにどの程度影響を与えるか?
主な発見
- SOLIDでファインチューニングしたモデルは、OLIDテストセットにおいて顕著な性能向上を示し、特に既存のデータセットでリソースが不足している分類階層の下位レベルで顕著である。
- 性能向上は特に標的特定レベル(レベルC)で顕著であり、これは訓練インスタンス数が最小であるにもかかわらず、半教師あり拡張の有効性を示している。
- アンサンブル半教師ありアプローチは、単一モデルの予測と比較して、ラベルノイズとバイアスを低減しており、多様なモデルアーキテクチャにわたる一貫性の高さとアノテーター間一致度の向上によって裏付けられている。
- データセットには、EASY(明示的)およびHARD(暗黙的)な攻撃的例の包括的分析が含まれており、SOLIDで訓練されたモデルが、繊細なまたは間接的な攻撃的表現への一般化性能を向上させていることが示された。
- SOLIDにおける攻撃的ツイートと非攻撃的ツイートの比率は、キーワードベースのデータセットと比較してよりバランスが取れており、選択バイアスが低減していることが示された。
- データセットは公開されており、SemEval-2020 OffensEval共同タスクの公式トレーニングセットとして採用されており、研究コミュニティにおける有用性と信頼性を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。