[論文レビュー] CUSATNLP@HASOC-Dravidian-CodeMix-FIRE2020:Identifying Offensive Language from ManglishTweets
この論文では、ローマ字表記のマングリッシュ(マラヤーラム語-英語のコードミックス)ツイートにおける攻撃的言語を識別するニューラルネットワークベースの手法を提示している。2種類の埋め込み手法(Keras埋め込みとDoc2Vec)と3つの分類器システムを用いている。最も優れたモデルは、2つの分類器の重み付きアンサンブルであり、重み付きF1スコア0.54を達成し、不均衡で低リソースなコードミックス攻撃的言語検出において中程度の有効性を示した。
With the popularity of social media, communications through blogs, Facebook, Twitter, and other plat-forms have increased. Initially, English was the only medium of communication. Fortunately, now we can communicate in any language. It has led to people using English and their own native or mother tongue language in a mixed form. Sometimes, comments in other languages have English transliterated format or other cases; people use the intended language scripts. Identifying sentiments and offensive content from such code mixed tweets is a necessary task in these times. We present a working model submitted for Task2 of the sub-track HASOC Offensive Language Identification- DravidianCodeMix in Forum for Information Retrieval Evaluation, 2020. It is a message level classification task. An embedding model-based classifier identifies offensive and not offensive comments in our approach. We applied this method in the Manglish dataset provided along with the sub-track.
研究の動機と目的
- コードミックスされたソーシャルメディアテキストにおける攻撃的コンテンツを検出する課題に対処すること、特にローマ字表記のマングリッシュ(マラヤーラム語)を対象とする。
- 従来のモデルが性能を発揮しにくい低リソースで多言語的な文脈において、攻撃的言語を分類する強固なシステムを開発すること。
- Keras埋め込みとDoc2Vecという異なる埋め込み技術が、コードミックステキストにおける攻撃的言語検出に与える影響を評価すること。
- 複数の分類器の予測を統合するアンサンブル手法が、不均衡なデータセットにおける性能向上に寄与するかどうかを検討すること。
- ドゥラヴィダ語系コードミックスソーシャルメディアコンテンツにおける攻撃的言語検出の再現可能システムを提供すること、特にFIRE 2020 HASOCサブトラックを対象とする。
提案手法
- テキスト前処理では、URL、ユーザーネーム、ハッシュタグ、繰り返し文字、数字を削除し、すべてのテキストを小文字に変換する。処理にはtweet-preprocessorライブラリを用いた。
- 文の表現は2つの方法で生成された:(1) 1-of-Kエンコーディングとパディングを施したシーケンスを用いたKeras埋め込み層により50次元のベクトルを出力し、(2) 変動長のテキストから分散表現を学習するDoc2Vec。
- 3つの異なる分類システムを実装した:システムAは、0.2の再帰的ドロップアウトを備えた単方向LSTMとシグモイド出力層を用いた。システムBは、ReLU活性化関数を用いた3層の全結合ネットワークとシグモイド出力層を用いた。
- システムCは、システムAとBの予測を統合する意思決定関数を用いた:両モデルがクラスで合意している場合、その結果を採用する。そうでない場合は、予測確率の合計が1を超えるかどうかでクラスを決定する。
- すべてのモデルはバイナリクロスエントロピー損失を用いて訓練され、精度、再現率、F1スコアで評価された。クラスの不均衡に対処するため、重み付き平均F1スコアが使用された。
- 評価は1,000件のマングリッシュツイートから成るテストセットを用い、scikit-learnのclassification_report関数で指標を計算した。
実験結果
リサーチクエスチョン
- RQ1LSTM や全結合ネットワークといった従来のニューラルネットワークアーキテクチャは、コードミックスされたマングリッシュツイートにおける攻撃的コンテンツ検出にどの程度有効か?
- RQ2Keras埋め込みとDoc2Vecという異なる埋め込み技術は、低リソースでコードミックスされたテキストにおける攻撃的言語検出性能にどの程度影響を与えるか?
- RQ3複数の分類器をアンサンブル化することで、個々のモデルに比べて不均衡なコードミックスデータセットにおける検出性能が向上するか?
- RQ4FIRE 2020 HASOCドゥラヴィダ語コードミックス攻撃的言語検出タスクにおいて、単純なトランスフォーマー非ベースモデルの性能はいかほどか?
- RQ5低リソースで多言語的な文脈において、攻撃的・非攻撃的クラスの間で精度、再現率、F1スコアはどのように変動するか?
主な発見
- Keras埋め込みとLSTMを用いたシステムAは、重み付きF1スコア0.53を達成し、平均して精度と再現率が両方0.54であった。
- Doc2Vecと深層全結合ネットワークを用いたシステムBは、重み付きF1スコア0.48にとどまり、少数派の攻撃的クラス(F1=0.40)では性能が劣っていた。
- システムAとBの予測を統合するアンサンブルモデルであるシステムCは、最高の重み付きF1スコア0.54を達成し、アンサンブル手法が個々のモデルの弱みを補完できることを示した。
- すべてのシステムにおけるマイクロおよびマクロF1スコアは約0.54であり、一貫性はあったが、中程度の全体的な性能であった。
- モデルは「攻撃的でない」クラスの再現率が高かった(システムAでは0.60)が、「攻撃的」クラスでは困難を示し、特にシステムBでは再現率が0.32まで低下した。
- 高度な埋め込み技術を用いても、モデルの性能は中程度にとどまり、ドゥラヴィダ語系コードミックス言語における表現学習の分野には依然として大きな改善余地があることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。