[論文レビュー] QutNocturnal@HASOC'19: CNN for Hate Speech and Offensive Content Identification in Hindi Language
本稿では、0.5百万件の関連するヒンディー語およびヒングリッシュツイートを用いて事前学習されたドメイン固有の単語埋め込みを活用し、ヒンディー語における嫌がらせ発言および攻撃的コンテンツ検出のための高性能なCNNモデル、QutNocturnal@HASOC'19を提示する。このアプローチは、ツイートのノイズに強く、局所的なパターンを捉える能力があるため、LSTMや従来のモデルを上回り、テストセットで82%の正確性を達成する最先端の性能を発揮する。
We describe our top-team solution to Task 1 for Hindi in the HASOC contest organised by FIRE 2019. The task is to identify hate speech and offensive language in Hindi. More specifically, it is a binary classification problem where a system is required to classify tweets into two classes: (a) \emph{Hate and Offensive (HOF)} and (b) \emph{Not Hate or Offensive (NOT)}. In contrast to the popular idea of pretraining word vectors (a.k.a. word embedding) with a large corpus from a general domain such as Wikipedia, we used a relatively small collection of relevant tweets (i.e. random and sarcasm tweets in Hindi and Hinglish) for pretraining. We trained a Convolutional Neural Network (CNN) on top of the pretrained word vectors. This approach allowed us to be ranked first for this task out of all teams. Our approach could easily be adapted to other applications where the goal is to predict class of a text when the provided context is limited.
研究の動機と目的
- ヒンディー語のような低リソース言語における嫌がらせ発言および攻撃的コンテンツ検出のための効果的な自然言語処理ソリューションの不足に対処すること。
- タスク固有の単語埋め込みを用いたトランスファーラーニングにより、ノイズが多く、非形式的なソーシャルメディアテキストにおける分類性能を向上させること。
- 短くノイズが多く、文脈的に複雑なヒンディー語ツイートにおける攻撃的言語検出において、CNNがLSTMのようなRNNモデルを上回るかを検証すること。
- 関連する未ラベル付きソーシャルメディアデータ上で単語ベクトルをファインチューニングすることで、低リソース言語タスクにおけるモデルの一般化性能が向上することを示すこと。
提案手法
- ランダムに選択されたヒンディー語および皮肉を含むヒングリッシュツイートから構成される0.5百万件のツイートコーパスを用いて、ドメイン固有の言語的パターンを捉えるために事前学習された単語埋め込み。
- de-identification、文字正規化、HTMLエスケープの解除、およびspaCyと軽量なヒンディー語スティーマーを用いたマルチリンガルの語彙還元を含む、広範な前処理を実施。
- ヒンディー語ツイートをHOF(嫌がらせまたは攻撃的)またはNOTにエンドツーエンド分類する目的で、事前学習済み単語ベクトルの上にカスタム畳み込みニューラルネットワーク(CNN)を訓練。
- CNNの学習中に事前学習済み単語ベクトルをファインチューニングすることで、トランスファーラーニングを適用し、下流の分類タスクに適応。
- ハイパーパramータチューニングのため、トレーニングセットで10分割交差検証を実施し、トレーニングデータの20%を検証用に割り当てた。
- 性能評価のため、DNN、SVM、RF、XGBoost、kNN、LSTM、MNBなど複数のベースラインとCNNモデルを比較した。
実験結果
リサーチクエスチョン
- RQ1未ラベル付きのヒンディー語およびヒングリッシュツイート上で事前学習されたドメイン固有の単語埋め込みは、一般ドメインの事前学習と比較して、嫌がらせ発言検出性能を向上させるか?
- RQ2短くノイズが多く、文脈的に複雑なヒンディー語ソーシャルメディアテキストにおける攻撃的コンテンツ分類において、CNNアーキテクチャはLSTMのようなRNNベースのモデルを上回るか?
- RQ3低リソース言語設定(例:ヒンディー語)において、タスク固有の単語ベクトルを用いたトランスファーラーニングはどの程度効果的か?
- RQ4皮肉、誤字、コードミキシングなどの言語的パターンは、攻撃的言語検出におけるさまざまなディープラーニングアーキテクチャの性能にどの程度影響を与えるか?
主な発見
- CNNモデルはテストセットで82%の正確性を達成し、マクロF1スコアは0.81を記録し、HASOC'19のヒンディー語嫌がらせ発言検出タスクで最上位ランクのソリューションとなった。
- CNNモデルは、マクロF1スコア0.78を記録したLSTMを上回り、ツイートのノイズに対して優れた耐性を示した。
- テストセットでは、HOFクラスに対して精度0.85、再現率0.74を達成し、NOTクラスに対しては精度0.80、再現率0.89を達成した。
- ドメイン固有の単語埋め込みのファインチューニングにより、kNNやMNBといったベースラインモデル(F1スコア0.52未満)と比較してF1スコアが10%向上した。
- ノイズが語順を歪めても局所的で非順序的なパターンを捉える能力があるため、CNNはこのタスクにおいて、LSTMのような系列ベースのモデルよりも効果的であることが示された。
- 関連する未ラベル付きツイートコーパスを用いた単語埋め込みの事前学習により、トランスファーラーニングが顕著にモデル性能を向上させ、特に低リソース設定において顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。