[論文レビュー] Hate Speech Detection on Vietnamese Social Media Text using the Bi-GRU-LSTM-CNN Model
この論文は、ベトナム語のヘイトスピーチ検出のためのBi-GRU-LSTM-CNN分類器をVLSP 2019で実装し、公開テストでF1 70.576%を達成し5位にランク付けしました。
In recent years, Hate Speech Detection has become one of the interesting fields in natural language processing or computational linguistics. In this paper, we present the description of our system to solve this problem at the VLSP shared task 2019: Hate Speech Detection on Social Networks with the corpus which contains 20,345 human-labeled comments/posts for training and 5,086 for public-testing. We implement a deep learning method based on the Bi-GRU-LSTM-CNN classifier into this task. Our result in this task is 70.576% of F1-score, ranking the 5th of performance on public-test set.
研究の動機と目的
- ベトナム語のソーシャルメディアにおけるヘイトスピーチ検出を低資源NLPタスクとして動機づける。
- 3クラス分類(HATE、OFFENSIVE、CLEAN)用のニューラルアーキテクチャを開発・比較する。
- VLSP 2019データ上でBi-GRU-LSTM-CNNモデルの有効性を示す。
提案手法
- テキストを小文字化、空白・句読点の除去、数字の置換、PyViでのトークン化を行う。
- FastText埋め込みを用いて文を220×300の語嵌入行列として表現する。
- 特徴抽出のためにドロップアウト付きの1D CNNを適用し、その後Bi-LSTMとBi-GRUブロックを適用する。
- 3つのラベル(HATE、OFFENSIVE、CLEAN)を用いて分類器を学習し、F1スコアで評価する。
- TextCNN、Bi-GRU-CNN、Bi-GRU-LSTM-CNNアーキテクチャを比較して最良のモデルを特定する。
実験結果
リサーチクエスチョン
- RQ1他のニューラルアーキテクチャと比較した場合、Bi-GRU-LSTM-CNNはベトナム語のヘイトスピーチ検出にどの程度効果的か?
- RQ2異なるニューラルコンポーネント(CNN、Bi-LSTM、Bi-GRU)はVLSP 2019データの分類性能にどう寄与するか?
- RQ33クラス分類でVLSP 2019公開テストで達成可能なF1スコアはどれか?
- RQ4モデルは公開テストとプライベートテストセットでどのように順位づけされるか?
主な発見
- Bi-GRU-LSTM-CNNはテストしたモデルの中で最も高いF1スコアを示し、70.576%を達成。
- TextCNNとBi-GRU-CNNはそれぞれ56.512%と69.293%のF1を達成。
- 公開テストでは、Bi-GRU-LSTM-CNNが上位5件の5位にランクイン。
- このアプローチは公開テストでは他のチームと概ね同等の性能だが、プライベートテストではそうではない。
- 使用データセットにはトレーニング20,345件とテスト5,086件の3つのラベル(HATE、OFFENSIVE、CLEAN)が含まれる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。