[論文レビュー] How Hateful are Movies? A Study and Prediction on Movie Subtitles
本研究では、11,000件の映画字幕をハラスメント、攻撃的、通常の発言の3クラスにラベル付けした新規データセットを紹介し、ソーシャルメディア(Twitter、Fox News)からの転移学習を用いて映画対話におけるハラスメントおよび攻撃的コンテンツを検出する手法を評価している。映画字幕で微調整されたBERTモデルは、マクロF1スコア77%を達成し、文脈的・言語的差異があるにもかかわらず、ソーシャルメディアにおけるハラスメント発言検出の転移学習が映画字幕に効果的に適用できることを示している。
In this research, we investigate techniques to detect hate speech in movies. We introduce a new dataset collected from the subtitles of six movies, where each utterance is annotated either as hate, offensive or normal. We apply transfer learning techniques of domain adaptation and fine-tuning on existing social media datasets, namely from Twitter and Fox News. We evaluate different representations, i.e., Bag of Words (BoW), Bi-directional Long short-term memory (Bi-LSTM), and Bidirectional Encoder Representations from Transformers (BERT) on 11k movie subtitles. The BERT model obtained the best macro-averaged F1-score of 77%. Hence, we show that transfer learning from the social media domain is efficacious in classifying hate and offensive speech in movies through subtitles.
研究の動機と目的
- 既存のソーシャルメディアにおけるハラスメント発言検出モデルが映画字幕に適用された際の限界を調査すること。
- 転移学習を用いて、映画字幕におけるハラスメントおよび攻撃的発言を検出する分類モデルの開発および評価を行うこと。
- ハラスメント、攻撃的、通常の内容の3クラスにラベル付けされた11,000件の映画字幕発話から構成される新規で公開可能なデータセットを作成すること。
- Bag of Words、Bi-LSTM、BERTといった異なるNLPアーキテクチャが、映画対話におけるハラスメントおよび攻撃的発言の分類にどの程度有効であるかを調査すること。
- 今後のメディアベースのハラスメント発言検出研究を支援するため、データセット、微調整済みモデル、およびコードを公開すること。
提案手法
- アノテーターが6部の映画から抽出した11,000件の映画字幕発話を、ハラスメント、攻撃的、通常の3クラスに、バッチベースで文脈を考慮したアノテーションプロセスを用いてラベル付けした。
- 本研究では、ドメイン適応および微調整を用いた転移学習を採用し、TwitterおよびFox Newsデータセットから事前学習されたモデルを用いて、映画字幕における性能を向上させた。
- 3つのモデルを評価した:Bag of Wordsベースライン、順序付き対話パターンを捉えるためのBi-LSTM、文脈表現学習のためのBERT。
- BERTモデルは、データ漏洩を避けるためにk分割交差検証を用いて、映画字幕データセットで微調整した。
- ソーシャルメディアのテキストと映画対話の構造をよりよく一致させるために、字幕断片を統合する手法を開発した。
- すべてのモデルはマクロ平均F1スコアを用いて評価され、アノテーションの不一致およびモデル予測の定性的分析も実施した。
実験結果
リサーチクエスチョン
- RQ1ソーシャルメディアにおけるハラスメント発言検出モデルが映画字幕に適用された際の限界は何か?
- RQ2ソーシャルメディアおよびニュースドメインからの転移学習は、映画字幕におけるハラスメントおよび攻撃的発言の分類にどの程度効果的か?
- RQ3Bag of Words、Bi-LSTM、BERTのうち、どのNLPアーキテクチャが映画字幕におけるハラスメント発言検出で最も優れた性能を示すか?
- RQ4アノテーションの不一致および文脈的ギャップは、映画対話におけるハラスメント発言検出の信頼性にどのように影響するか?
- RQ5データシャッフルを伴わずに、微調整済みBERTモデルが新しい未観測の映画に一般化できるか?(実世界の展開の現実性を保ったまま)
主な発見
- BERTモデルは、ハラスメントと攻撃的発言の区別において、Bag of WordsおよびBi-LSTMベースラインを著しく上回る最高のマクロ平均F1スコア77%を達成した。
- 本研究では、『Django Unchained』や『BlacKkKlansman』のように人種的差別的・憎悪的とされる映画が、最も高い割合のハラスメント発言を含んでおり、一方『The Wolf of Wall Street』のような友情をテーマにした映画では、ハラスメント発言は少ないものの攻撃的発言の割合が高かった。
- アノテーションの不一致が頻発しており、特に「nigger」や「shit」のようなスラングでは、文脈や発話者の意図が分類に強く影響するため、ハラスメント発言検出の主観性が顕著に現れた。
- すべてのモデルの性能は「通常」クラスで最も高く、これは「攻撃的」と「ハラスメント」発言の区別が依然として大きな課題であることを示している。
- 映画字幕データセットでBERTを微調整することで、ドメイン適応モデルよりも顕著に性能が向上した。これは、高精度を達成するには、ドメイン内データでの微調整が不可欠であることを示している。
- 研究者らは、再現可能性および今後のメディアベースのハラスメント発言検出研究を支援するため、全データセット、モデル、コードを公開した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。