[論文レビュー] Korean Online Hate Speech Dataset for Multilabel Classification: How Can Social Science Improve Dataset on Hate Speech?
本稿は、文化的・言語的配慮に基づいたアプローチを用い、7つのカテゴリ—人種/民族、宗教、地方主義、年齢差別、ミソジニー、性的マイノリティ、男性—をカバーするマルチラベル韓国語オンラインいじめ発言データセットを紹介する。35,000件のサンプル(人間によるアノテーションとルール生成データを含む)を用い、データ拡張後にLRAPスコア0.919を達成した。これは、社会学的知見を活用することで、西洋中心の二値分類フレームワークを超えたいじめ発言データセットの改善が可能であることを示している。
We suggest a multilabel Korean online hate speech dataset that covers seven categories of hate speech: (1) Race and Nationality, (2) Religion, (3) Regionalism, (4) Ageism, (5) Misogyny, (6) Sexual Minorities, and (7) Male. Our 35K dataset consists of 24K online comments with Krippendorff's Alpha label accordance of .713, 2.2K neutral sentences from Wikipedia, 1.7K additionally labeled sentences generated by the Human-in-the-Loop procedure and rule-generated 7.1K neutral sentences. The base model with 24K initial dataset achieved the accuracy of LRAP .892, but improved to .919 after being combined with 11K additional data. Unlike the conventional binary hate and non-hate dichotomy approach, we designed a dataset considering both the cultural and linguistic context to overcome the limitations of western culture-based English texts. Thus, this paper is not only limited to presenting a local hate speech dataset but extends as a manual for building a more generalized hate speech dataset with diverse cultural backgrounds based on social science perspectives.
研究の動機と目的
- 既存のいじめ発言データセットが主に西洋的・英語圏の文脈に依存しているという文化的・言語的制限を是正すること。
- 二値分類を超えた複雑さを捉えることのできる、韓国語オンラインディス course用のマルチラベルいじめ発言データセットの開発。
- 社会学的視点をデータセット構築に統合することで、NLPモデルにおける代表性の向上と文化的バイアスの低減を図ること。
- 人間が関与するラベリングとルールベースの生成が、リソースが限られた文化的に特異な環境において、データ品質とモデル性能の向上に有効であることを示すこと。
提案手法
- データセットは、7つのいじめ発言カテゴリをマルチラベルフレームワークでラベル付けした24,000件のオンラインコメントから構成される。
- ラベルの信頼性を確保するため、インターアノテーター間整合性を評価するためにKrippendorff’s Alpha 0.713が用いられた。
- データバランスの向上とモデルの汎化性能の向上を目的に、追加の11,000件のサンプルが人間が関与するプロセスとルールベース手法により生成された。
- ベースとなるBERTベースのモデルは、初期の24,000件のデータセットで微調整され、その後11,000件の追加サンプルと組み合わせて再トレーニングされ、性能向上が評価された。
- データセット設計には、地方言語や階層的社交規範を含む、韓国特有の社会的・言語的文脈が組み込まれており、現地のいじめ発言の現れ方をより正確に反映している。
- 性能評価には、マルチラベル分類の有効性を反映するLabel Ranking Average Precision (LRAP) 指標が用いられた。
実験結果
リサーチクエスチョン
- RQ1社会学的知見は、英語圏でも西洋的でもない文脈におけるいじめ発言データセットの設計とアノテーションをどのように改善できるか?
- RQ2マルチラベルカテゴリを統合することで、韓国語オンラインディスコースにおけるいじめ発言検出モデルの代表性和パフォーマンスはどの程度向上するか?
- RQ3人間が関与するラベリングとルールベース生成の組み合わせは、品質を維持したまま、リソースが限られたいじめ発言データセットを効果的に拡張できるか?
- RQ4アノテーションにおける文化的・言語的特異性は、いじめ発言検出におけるモデルの汎化性能と公平性にどのように影響するか?
- RQ5マルチラベル設定において、コアデータセットに文脈的に適切な追加サンプルを追加することで、どの程度のパフォーマンス向上が達成できるか?
主な発見
- ベースモデルは初期の24,000件のデータセットでLRAPスコア0.892を達成し、強力なマルチラベル分類性能を示した。
- 追加の11,000件のサンプル(2,200件の人的ラベリング、7,100件のルール生成)を統合した後、モデルのLRAPは0.919に向上し、データ拡張の価値を示した。
- データセットはKrippendorff’s Alpha 0.713を達成しており、7つのいじめ発言カテゴリ全体で中程度以上のインターアノテーター間整合性が確認された。
- マルチラベルフレームワークは、ミソジニーと地方主義の重複するいじめ発言カテゴリを効果的に捉えており、これは韓国語オンラインディスコースで一般的な現象である。
- データセット設計に社会学的視点を統合した結果、二値分類アプローチに比べ、より洗練され、文脈的に正確ないじめ発言の表現が可能になった。
- 文化的に根ざしたアノテーションプロセスが、リソースが限られた非英語圏環境において、より信頼性が高く汎化可能ないじめ発言データセットの構築に寄与することを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。