Skip to main content
QUICK REVIEW

[論文レビュー] An exploratory experiment on Hindi, Bengali hate-speech detection and transfer learning using neural networks

Tung Minh Phung, Jan Cloos|arXiv (Cornell University)|Jan 6, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本稿では、ニューラルネットワークを用いたトランスファーラーニングにより、低リソースで計算コストが低いヒンディ語およびベンガル語向けの嫌がらせ発言検出システムを提案する。語彙埋め込みの微調整およびヒンディ語モデルから得た分類器重みの再利用により、ベンガル語データで82.98%の精度を達成した。これは、初期化から学習を開始する場合と同等の性能であり、明示的な翻訳監視がなく、データが限られているにもかかわらず、効果的なクロスリンガル知識移行が可能であることを示している。

ABSTRACT

This work presents our approach to train a neural network to detect hate-speech texts in Hindi and Bengali. We also explore how transfer learning can be applied to learning these languages, given that they have the same origin and thus, are similar to some extend. Even though the whole experiment was conducted with low computational power, the obtained result is comparable to the results of other, more expensive, models. Furthermore, since the training data in use is relatively small and the two languages are almost entirely unknown to us, this work can be generalized as an effort to demystify lost or alien languages that no human is capable of understanding.

研究の動機と目的

  • ニューラルネットワークを用いて、ヒンディ語およびベンガル語向けの低計算コストの嫌がらせ発言検出モデルを開発すること。
  • 限られたラベル付きデータがあるにもかかわらず、ヒンディ語からベンガル語へのトランスファーラーニングが性能向上に寄与するかどうかを調査すること。
  • ヒンディ語とベンガル語の共通の言語的ルーツが、自然言語処理タスクにおける効果的な知識移行を可能にするかどうかを評価すること。
  • トランスファーラーニングが、一致する意味的表現を学習することで、間接的に単語レベルの翻訳を支援できるかどうかを検討すること。
  • 特に汎化性能および過学習の観点から、初期化から学習を開始するモデルとトランスファーラーニングを用いたモデルの性能を比較すること。

提案手法

  • ユーザー名、標点符号、ストップワードを除去しながら、ハッシュタグは保持し、英語語彙のケースを正規化することで、生のソーシャルメディアテキストを前処理する。
  • 300次元のベクトル空間と10のコンテキスト窓を用いたスキップグラムアーキテクチャにより、語彙埋め込みを学習する。
  • 学習済み埋め込みの上に2層のフィードフォワードニューラルネットワーク分類器を構築し、嫌がらせ発言分類を実行する。
  • バッチ正規化、ドロップアウト、学習率スケジューリングといった強化された学習技術を適用し、モデルの汎化性能を向上させる。
  • ヒンディ語モデルの重みを用いてベンガル語モデルの重みを初期化することで、トランスファーラーニングを実装する。特に、語彙埋め込み層を除く層の重みを再利用する。
  • ヒンディ語とベンガル語の語彙埋め込みを翻訳した場合のコサイン類似度を計算することで、単語翻訳の可能性を評価する。

実験結果

リサーチクエスチョン

  • RQ1低リソースなヒンディ語嫌がらせ発言データで学習したニューラルネットワークが、最小限の計算コストでベンガル語でも競争力のある性能を達成できるか?
  • RQ2初期化から学習を開始する場合と比較して、ヒンディ語からベンガル語へのトランスファーラーニングが分類精度を向上させるか?
  • RQ3同じデータセットサイズとラベル分布を有するにもかかわらず、ベースラインのヒンディ語-ヒンディ語モデルは性能低下を示す一方で、ベンガル語-ベンガル語モデルはそうではないのはなぜか?
  • RQ4明示的なアライメントなしに、ヒンディ語とベンガル語間のトランスファーラーニングが意味的に整合する単語レベルの翻訳表現を生成できるか?
  • RQ5ヒンディ語分類器の非語彙埋め込み層のみを再利用する固定重みトランスファーラーニングは、どれほど効果的か?

主な発見

  • 強化されたヒンディ語-ヒンディ語モデルは、テスト精度80.73%を達成し、ベースラインから10%の向上を示した。また、エポック8以降に性能低下が見られなかった。
  • 強化された訓練を施したベンガル語-ベンガル語モデルは82.98%の精度を達成し、ベースラインから約4%の向上を示した。
  • ヒンディ語-ベンガル語のトランスファーラーニングモデルは80.40%の精度を達成し、ベースラインからわずか2%の向上を示した。ベースライン自体がエポック6以降から約80%の性能を示しており、すでに高い水準にあった。
  • 特にヒンディ語-ヒンディ語およびベンガル語-ベンガル語の強化モデルは、汎化性能が向上し、過学習を回避した。これに対して、ベースラインモデルはそうではなかった。
  • コサイン類似度による評価では、意味的に整合する単語対の翻訳が観察されなかった。これは、ベンガル語の語彙埋め込み層がヒンディ語語彙の同等表現に収束していないことを示唆している。
  • ヒンディ語-ベンガル語モデルで転送された重み(非語彙埋め込み層)を固定しても、性能に顕著な向上が見られなかった。これは、ベースラインモデル自体がすでに高い性能を発揮していたことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。