[論文レビュー] Lifelong Learning of Hate Speech Classification on Social Media
本稿では、ソーシャルメディアにおける微細な嫌がらせ発言分類のための生涯学習フレームワークを提案する。変分表現学習(VRL)とLB-SOINNベースのメモリモジュールを組み合わせることで、深刻な忘却を軽減する。本手法は、タスク固有の知識を分離された潜在分布に抽出し、重要な訓練サンプルを効率的に保持することで、タスク多様性が高く、シーケンス長が増加する状況でも最先端の生涯学習手法を上回る優れた性能を達成する。
Existing work on automated hate speech classification assumes that the dataset is fixed and the classes are pre-defined. However, the amount of data in social media increases every day, and the hot topics changes rapidly, requiring the classifiers to be able to continuously adapt to new data without forgetting the previously learned knowledge. This ability, referred to as lifelong learning, is crucial for the real-word application of hate speech classifiers in social media. In this work, we propose lifelong learning of hate speech classification on social media. To alleviate catastrophic forgetting, we propose to use Variational Representation Learning (VRL) along with a memory module based on LB-SOINN (Load-Balancing Self-Organizing Incremental Neural Network). Experimentally, we show that combining variational representation learning and the LB-SOINN memory module achieves better performance than the commonly-used lifelong learning techniques.
研究の動機と目的
- 既存の嫌がらせ発言分類器が静的で事前に定義されたデータセットを仮定しており、進化するソーシャルメディアのコンテンツに適応できないという限界を解消すること。
- オンラインのトピックやイデオロギーの急速な変化によって引き起こされる非ステーションリティなデータ分布下でも、嫌がらせ発言分類における継続的学習を可能にすること。
- Twitter上での多様な嫌がらせグループのイデオロギーが示すように、連続するタスクの意味的類似度が低い状況においても、生涯学習シナリオにおける深刻な忘却を軽減すること。
- 再訓練を再び行わずに、増加する嫌がらせ発言分類タスクのシーケンス全体で高い性能を維持できるスケーラブルで頑健な手法を開発すること。
提案手法
- 嫌がらせイデオロギー(例:ムスリム嫌悪、KKK)ごとにグループ化されたサブデータセットを順次学習する、新しい生涯的微細な嫌がらせ発言分類タスクを提案する。
- タスク固有の知識を潜在変数分布に抽出することで、知識の保持を促進し、忘却を軽減するため、変分表現学習(VRL)を採用する。
- 各タスクの訓練データから最も代表的なサンプルを動的に選別・保存するため、負荷バランス型自己組織的増分ニューラルネットワーク(LB-SOINN)メモリモジュールを導入する。
- 二重ブランチアーキテクチャを採用:一方のブランチはKLダイバージェンス正則化を伴うVAEベースの表現学習を、もう一方はタスク固有の分類を担当する。
- VRLとLB-SOINNによるメモリリプレイを組み合わせることで、新しいタスクの学習を安定化させつつ、過去のタスクの性能を維持する。
- VAEにおける多次元ガウス事前分布を活用することで、構造的でクラスタリング可能な隠れ表現を促進し、LB-SOINNのトポロジー学習を強化する。
実験結果
リサーチクエスチョン
- RQ1新しい類似しないタスクが導入された場合、生涯学習フレームワークは、以前に学習した嫌がらせ発言分類タスクの性能を効果的に維持できるか?
- RQ2VRLとLB-SOINNメモリモジュールの組み合わせは、EWC、GEM、RMRといった標準的な生涯学習ベースラインと比較して、深刻な忘却の軽減においてどのように優れているか?
- RQ3隠れ表現の質、特にその分布的構造が、生涯学習におけるメモリベースのリプレイの効果にどのように影響するか?
- RQ4順次学習において初期タスクの性能が著しく低下する理由は何か?これはアーキテクチャ的または事前学習の調整によって緩和可能か?
主な発見
- 提案手法であるVRL + LB-SOINNは、EWC、GEM、RMRを含むすべてのベースライン手法よりも顕著に高い平均F1スコアを達成し、タスク数が増加するにつれてその差が顕著になる。
- マルチタスク学習を上回る性能を示しており、混合タスクの共同学習よりも、適切な忘却抑制を伴う順次学習がより効果的であることを示している。
- 最初のタスクにおける性能低下は、VAEにおける再構成損失最適化が不十分なために初期に顕著に現れるが、タスク数が増えるにつれてこのギャップは急速に縮小する。
- メモリ表現におけるKLダイバージェンス損失項($D_{KLmem}$)を除去すると、タスク数の増加に伴い性能が著しく低下するため、知識蒸留と忘却防止におけるその重要性が裏付けられる。
- LB-SOINNは、VRLが生成する構造的でガウス型の潜在表現を効果的に活用できるため、メモリ効率と安定性の点でRMRを上回る。
- タスク間類似度が低い状況(例:キリスト教アイデンティティの平均ジャコービ指数が0.019)でも、多様な嫌がらせグループのイデオロギーにわたり強力な一般化性能を維持している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。