[論文レビュー] Offensive Language Analysis using Deep Learning Architecture
本稿では、SemEval-2019 タスク6におけるSNS上の攻撃的言語検出のためのBiLSTM-CNNディープラーニングアーキテクチャを提案する。このアーキテクチャは、他のCNN-RNN構成よりも優れた性能を示した。著者らは、RNN層をCNN層よりも前に配置することで、マクロF1スコアが著しく向上することを発見した。一方で、CNN層の追加は最小限の利益にとどまり、順序情報の損失により性能が低下することもあった。最良のモデルでは、サブタスクAで0.75のマクロF1、サブタスクBで0.65、サブタスクCで0.46を達成した。
SemEval-2019 Task 6 (Zampieri et al., 2019b) requires us to identify and categorise offensive language in social media. In this paper we will describe the process we took to tackle this challenge. Our process is heavily inspired by Sosa (2017) where he proposed CNN-LSTM and LSTM-CNN models to conduct twitter sentiment analysis. We decided to follow his approach as well as further his work by testing out different variations of RNN models with CNN. Specifically, we have divided the challenge into two parts: data processing and sampling and choosing the optimal deep learning architecture. In preprocessing, we experimented with two techniques, SMOTE and Class Weights to counter the imbalance between classes. Once we are happy with the quality of our input data, we proceed to choosing the optimal deep learning architecture for this task. Given the quality and quantity of data we have been given, we found that the addition of CNN layer provides very little to no additional improvement to our model's performance and sometimes even lead to a decrease in our F1-score. In the end, the deep learning architecture that gives us the highest macro F1-score is a simple BiLSTM-CNN.
研究の動機と目的
- ディープラーニングを用いてSNSのテキストにおける攻撃的言語を特定・分類すること。
- SMOTEとクラスウェイトを用いて、攻撃的言語データセットのクラス不均衡を緩和すること。
- RNN-CNNのレイヤー順序と各部品の有効性に注目し、攻撃的言語検出のための最適なディープラーニングアーキテクチャを特定すること。
- 事前学習済み単語埋め込みとハイパーパramータチューニングがモデル性能に与える影響を評価すること。
提案手法
- 分類用に単語埋め込み、スパatialドロップアウト、および全結合層を備えたBiLSTM-CNNアーキテクチャを用いた。
- URLの削除、@USERトークンの除去、縮約語の展開、特殊文字の処理を含むマルチステージの前処理パイプラインを適用した。
- GloVe Twitter (100d, 200d) および GloVe Common Crawl (300d) の3種類の事前学習済み単語埋め込みを検証した。
- クラス不均衡の影響を考慮し、主評価指標としてマクロF1スコアを採用した。
- 5分割交差検証を実施し、バリデーションマクロF1スコアに基づく早期停止と20%のホールドアウトテストセットを用いた。
- エポック数、スパatialドロップアウト率、埋め込みタイプの手動ハイパーパramータチューニングを実施した。
実験結果
リサーチクエスチョン
- RQ1RNN層とCNN層の順序が攻撃的言語分類性能に顕著な影響を及えるか?
- RQ2CNN層を追加することで、攻撃的言語検出性能が向上するのか、それとも順序情報の損失により劣化するのか?
- RQ3SMOTEとクラスウェイトは、サブタスクA、B、Cのすべてにおいてクラス不均衡を効果的に緩和できるか?
- RQ4マクロF1スコアを最大化するための、最適な事前学習済み単語埋め込みとハイパーパramータの組み合わせは何か?
主な発見
- BiLSTM-CNNアーキテクチャが、すべてのサブタスクで最高のマクロF1スコアを達成し、他のすべてのモデル変種を上回った。
- RNN層をCNN層よりも前に配置した場合(BiLSTM → CNN)が、CNN → BiLSTMの順序よりも顕著に優れた性能を示し、F1スコアで0.07~0.09の向上を達成した。
- CNN層の追加は最小限の利益にとどまり、場合によっては性能を悪化させた。これは、テキストの順序的文脈情報の損失に起因すると考えられる。
- 最適な訓練エポック数は5であった。それ以上に増やすと性能が頭打ちまたは低下した。
- スパatialドロップアウト率20%が最適であったが、ドロップアウトを完全に削除しても影響がほとんどなかったため、現在のアーキテクチャでは過学習が顕著でないことが示唆された。
- 事前学習済み単語埋め込み、特に300dのGloVe Common Crawlは、ランダムまたは無しの埋め込みよりも性能を向上させた。ただし、BiGRU-CNNとの組み合わせでは結果にわずかな差が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。