[論文レビュー] VAIS Hate Speech Detection System: A Deep Learning based Approach for System Combination
本論文は、ベトナム語SNSにおける嫌がらせ発言検出のための深層学習ベースのアンサンブルシステムVAISを提案する。複数のテキスト表現(CBOW、fastText、sonvx、RoBERTa)とモデル(TextCNN、LSTM-CNN、VDCNN、SARNN)をスタッキングアンサンブルにより統合することで分類性能を向上させた。このシステムはVLSP 2019で公式リーダーボードで0.730のF1マクロスコア、非公式リーダーボードで0.584を達成した。
Nowadays, Social network sites (SNSs) such as Facebook, Twitter are common places where people show their opinions, sentiments and share information with others. However, some people use SNSs to post abuse and harassment threats in order to prevent other SNSs users from expressing themselves as well as seeking different opinions. To deal with this problem, SNSs have to use a lot of resources including people to clean the aforementioned content. In this paper, we propose a supervised learning model based on the ensemble method to solve the problem of detecting hate content on SNSs in order to make conversations on SNSs more effective. Our proposed model got the first place for public dashboard with 0.730 F1 macro-score and the third place with 0.584 F1 macro-score for private dashboard at the sixth international workshop on Vietnamese Language and Speech Processing 2019.
研究の動機と目的
- ベトナム語SNSプラットフォームにおける嫌がらせ発言および攻撃的コンテンツの検出という課題に対処すること。
- ベトナム語テキストにおける多クラス嫌がらせ発言検出タスク(嫌がらせ、攻撃的、クリーン)の分類性能を向上させること。
- ベトナム語SNSテキストにおけるデータの不均衡および言語的多様性(例:ティーンエイジャー用コード、タイポ、絵文字)に対処すること。
- 多様なテキスト表現と深層学習アーキテクチャを統合することで、一般化性能が向上する堅牢なアンサンブルベースのモデルを開発すること。
- VLSP 2019で実施されたベトナム語嫌がらせ発言検出共有タスクにおいて最先端の性能を達成すること。
提案手法
- エンコードの標準化、アクセント記号の正規化、および複数のトークナイゼーション戦略(空白、BPE、構文素性トークナイゼーション)を適用することで、生のベトナム語テキストを前処理する。
- 異なる埋め込みサイズと学習戦略を用いて、CBOW、fastText、sonvx、RoBERTa埋め込みを用いて複数のテキスト表現を生成する。
- 統合表現上で複数の深層学習モデル(TextCNN、LSTM-CNN、VDCNN、SARNN)を学習させ、多様な予測を生成する。
- スタッキングアンサンブル法を用い、ベースモデルの確率出力をメタラーナー(128ユニットの隠れ層を1層持つ全結合ニューラルネットワーク)の入力特徴として使用する。
- データの不均衡を緩和するために、クラス重み付き損失関数を適用し、クリーン、攻撃的、嫌がらせクラスにそれぞれ重み(0.09、0.95、0.96)を設定する。
- 90/10の訓練/開発分割でモデルを最適化し、アンサンブルスタッキングの前にF1マクロスコアに基づいて最も性能の良いモデルを選別する。
実験結果
リサーチクエスチョン
- RQ1多様な深層学習モデルとテキスト表現のアンサンブルは、ベトナム語SNSにおける多クラス嫌がらせ発言検出に対してどの程度効果的か?
- RQ2事前学習済みおよび自己学習済みの単語および文埋め込みは、リソースが限られたベトナム語テキストの分類性能をどの程度向上させられるか?
- RQ3データの不均衡はモデル性能にどのように影響するか?また、クラス重み付けは多数クラス(クリーン)への過学習を緩和できるか?
- RQ4公式リーダーボードで良好な結果を示したにもかかわらず、非公式リーダーボードで顕著な性能低下を示すのはなぜか?
- RQ5特定の語(例:'vl')のような言語的パターンが系統的な誤分類を引き起こす理由は何か?そして、それらをどのように緩和できるか?
主な発見
- VAISシステムは、VLSP 2019共有タスクの公式リーダーボードで0.73019のF1マクロスコア、非公式リーダーボードで0.58455のスコアを達成した。
- モデルは公式テストセットでは優れた性能(開発セットでF1-macro 0.7356)を示したが、公式テストセットに著しく過学習しており、非公式セットでは急激なスコア低下を示した。
- 誤分類されたインスタンスの大部分(攻撃的クラスで62%、嫌がらせクラスで48%)は、クリーンクラスに非常に頻出する語'vl'への過学習に起因していた。
- システムの性能はデータの不均衡に大きく影響を受けており、クラス重み付け(0.09、0.95、0.96)がモデルが常に'クリーン'を予測するのを防ぐために不可欠であった。
- アンサンブルアプローチにより耐性が向上したが、人間がラベル付けした場合でも、攻撃的と嫌がらせ発言の区別に苦労した。
- スタッキングアンサンブル法は多様なモデルの予測を効果的に統合したが、最終的な性能は過学習とトレーニングデータ内の言語的特異性によって制限された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。