Skip to main content
QUICK REVIEW

[論文レビュー] Fighting Offensive Language on Social Media with Unsupervised Text Style Transfer

Cícero Nogueira dos Santos, Igor Melnyk|arXiv (Cornell University)|May 20, 2018
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本稿では、並列学習データが不要な非教師付きテキストスタイル変換手法を提案する。攻撃的でないバージョンに変換するため、協調分類器、アテンション機構、サイクル整合性損失を組み合わせることで、スタイル変換の最先端の性能を達成した。2つの主要な指標において先行研究を上回り、TwitterおよびRedditのデータにおいて内容を保持したまま、自然で攻撃的でない出力を生成した。

ABSTRACT

We introduce a new approach to tackle the problem of offensive language in online social media. Our approach uses unsupervised text style transfer to translate offensive sentences into non-offensive ones. We propose a new method for training encoder-decoders using non-parallel data that combines a collaborative classifier, attention and the cycle consistency loss. Experimental results on data from Twitter and Reddit show that our method outperforms a state-of-the-art text style transfer system in two out of three quantitative metrics and produces reliable non-offensive transferred sentences.

研究の動機と目的

  • 攻撃的言語をフィルタリングするのではなく、元の意味を保持したまま攻撃的でない表現に変換することで、ソーシャルメディア上の攻撃的言語に対処すること。
  • 並列学習データが入手不可能な攻撃的言語から非攻撃的言語への翻訳に対応できる、非教師付きテキストスタイル変換フレームワークの開発。
  • 正解文対が存在しない状況下で、内容の保持とスタイル変換の質を向上させるために、アテンションとサイクル整合性を活用すること。
  • 実際のTwitterおよびRedditデータに基づく、攻撃的から非攻撃的へのテキストスタイル変換のための2つのベンチマークデータセットの導入。

提案手法

  • 入力文を符号化し、ターゲットスタイル(攻撃的から非攻撃的)に復号するGRUベースのRNNを用いたエンコーダデコーダアーキテクチャを採用。
  • 訓練のための信号を提供するため、敵対的判別器の代わりに協調分類器(CNN)を導入し、学習の安定化を図った。
  • 復号中に隠れ状態をアライメントするためのアテンション機構を採用し、生成文の内容保持と自然さを向上させた。
  • 元の文を再構築するために、変換済み文を逆方向に翻訳するバックトランスレーションを用いてサイクル整合性損失を適用し、内容保持を強制した。
  • 同じスタイルでの再構築(オートエンコーディング)のための交差エントロピー損失と、サイクル整合性損失、分類損失を組み合わせ、モデルをエンドツーエンドで学習。
  • RedditおよびTwitterの攻撃的および非攻撃的文の非並列コーパスを用い、スタイルラベルのみを監視信号として使用してモデルを学習。

実験結果

リサーチクエスチョン

  • RQ1非教師付きテキストスタイル変換は、並列データが存在しない状況下でも、攻撃的でない自然な表現に、意味を保持したまま変換できるか?
  • RQ2提案手法は、最先端の非教師付きスタイル変換と比較して、スタイル変換の正確性、内容保持、自然さの観点で優れているか?
  • RQ3アテンションとサイクル整合性損失は、スタイル変換の過程で内容保持にどの程度寄与しているか?
  • RQ4モデルの出力で一般的な誤りは何か。それらはパープレクサリティと意味的整合性にどのように影響を与えるか?

主な発見

  • Redditデータセットでは、分類精度が99.54%、内容保持度が0.933、パープレクサリティが115.75に達し、Shenら(2017)の手法を内容保持度と精度の両面で上回った。
  • Twitterデータセットでは、精度が99.63%、内容保持度が0.947、パープレクサリティが162.75に達し、スタイル変換と内容保持の両面で優れた性能を示した。
  • アブレーションスタディの結果、アテンションとバックトランスレーション損失の両方を削除すると、内容保持度は0.876に低下し、パープレクサリティは751.56に上昇した。これは、両者の手法が自然さと忠実度のバランスを保つ上で極めて重要であることを示している。
  • 定性的な分析から、本手法は攻撃的単語を非攻撃的同等に置き換えることに成功し、文構造を保持したが、先行モデルとは異なり、文の内容を著しく変更する傾向が少なかった。
  • 高い精度と内容保持度にもかかわらず、一部のケースで一般的な非攻撃的語(例:'f***ing' に対して 'big')の過剰使用により、不自然な表現が生じ、パープレクサリティが上昇した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。