Skip to main content
QUICK REVIEW

[論文レビュー] Towards Robust Toxic Content Classification

Keita Kurita, Anna Belova|arXiv (Cornell University)|Dec 14, 2019
Adversarial Robustness in Machine Learning参考文献 30被引用数 16
ひとこと要約

本稿では、文字レベルの摂動と非有毒な干渉トークンを用いて、毒性コンテンツ分類器に対する現実的でモデルに依存しない悪意のある攻撃を生成する手法を提案している。一部のケースでは、検出の再現率を50%以上著しく低下させる。また、耐性を高めるために文脈的ノイズ除去オートエノード(CDAE)と悪意のある訓練を導入し、CDAEとBERTをアンサンブル学習で組み合わせることで、両方の攻撃タイプに対して最も強固な防御が得られることを示している。

ABSTRACT

Toxic content detection aims to identify content that can offend or harm its recipients. Automated classifiers of toxic content need to be robust against adversaries who deliberately try to bypass filters. We propose a method of generating realistic model-agnostic attacks using a lexicon of toxic tokens, which attempts to mislead toxicity classifiers by diluting the toxicity signal either by obfuscating toxic tokens through character-level perturbations, or by injecting non-toxic distractor tokens. We show that these realistic attacks reduce the detection recall of state-of-the-art neural toxicity detectors, including those using ELMo and BERT, by more than 50% in some cases. We explore two approaches for defending against such attacks. First, we examine the effect of training on synthetically noised data. Second, we propose the Contextual Denoising Autoencoder (CDAE): a method for learning robust representations that uses character-level and contextual information to denoise perturbed tokens. We show that the two approaches are complementary, improving robustness to both character-level perturbations and distractors, recovering a considerable portion of the lost accuracy. Finally, we analyze the robustness characteristics of the most competitive methods and outline practical considerations for improving toxicity detectors.

研究の動機と目的

  • 最先端の毒性コンテンツ分類器が、現実的でモデルに依存しない悪意のある攻撃(文字レベルの摂動と干渉トークンの挿入)に対してどれほど脆弱であるかを調査すること。
  • 文字レベルの摂動と挿入された干渉トークンに対して耐性を高める防御手法を開発すること。
  • 悪意のある訓練と、新たな文脈的ノイズ除去オートエノード(CDAE)の有効性を、攻撃下での分類器の性能回復の観点から評価すること。
  • 異なる攻撃タイプの組み合わせに対して、BERT や CDAE などのさまざまなモデルの耐性特性を比較すること。
  • 実世界の展開において、より堅牢な毒性検出システムを構築するための実用的ガイドラインを提供すること。

提案手法

  • Jigsaw 2019 の大規模なバックグラウンドコーパスと毒性トークンの語彙を用いて、文字レベルの摂動(例:'u' を '*' に置換)や非有毒な干渉トークンの挿入を適用することで、悪意ある例を生成する。
  • 合成ノイズを含む訓練データを拡張することで、類似するノイズパターンに対して耐性を高めるために悪意のある訓練を実施する。
  • 文脈的ノイズ除去オートエノード(CDAE)を提案する。このモデルは、表現学習中に不正に変換されたトークンを復元・ノイズ除去するために、文字レベルの情報と文脈的情報を併用する。
  • マスクされたトークンの復元を用いて、摂動された入力から元のトークンを予測するように CDAE を訓練し、文字レベルの埋め込みとトランスフォーマーに基づく文脈的符号化を統合する。
  • CDAE と BERT をアンサンブルモデルで組み合わせることで、相補的な耐性を活用する:CDAE は文字レベルの変換に対して優れた性能を発揮し、BERT は干渉トークンの挿入に対して強い耐性を示す。
  • Jigsaw 2018、Jigsaw 2019、OffensEval 2019 といった複数のデータセットを用い、攻撃状態下での F1 値や再現率といった標準指標で防御の有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1文字レベルの摂動と干渉トークンの挿入を用いた単純でモデルに依存しない悪意のある攻撃に対して、最先端のニューラル毒性検出器はどれほど脆弱であるか?
  • RQ2合成ノイズを含むデータで悪意のある訓練を実施した場合、クリーンな非悪意のあるデータにおける性能を損なわずに、どれほど耐性が向上するか?
  • RQ3文脈的ノイズ除去オートエノード(CDAE)は、文字レベルの変換を効果的にノイズ除去しながら、文脈的な意味を保持する堅牢な表現を学習できるか?
  • RQ4異なるモデル(例:BERT 対 CDAE)は、異なる攻撃タイプに対して、それぞれどのように耐性特性を示すか?
  • RQ5CDAE と BERT のアンサンブルは、複数の攻撃ベクトルに対して、相補的な強みを組み合わせることで、優れた総合的耐性を達成できるか?

主な発見

  • 文字レベルの摂動と干渉トークンの挿入により、ELMo や BERT をベースとする最先端の毒性検出器の再現率が、一部のケースで50%以上低下した。
  • 悪意のある訓練は合成ノイズに対する耐性を高めるが、クリーンな非悪意のあるデータにおける性能に顕著な低下を引き起こした。
  • CDAE モデルは、文字レベルの情報と文脈的情報を併用することで、文字レベルの変換に対する耐性を著しく向上させた。
  • BERT をベースとするモデルは、CDAE よりも干渉トークンの挿入に対してより強い耐性を示したが、CDAE はこのような攻撃に対して脆弱であった。
  • CDAE と BERT のアンサンブルは、相補的な強みを組み合わせることで、個々のモデルを上回る総合的耐性を達成した。
  • 本研究では、モデルに依存しない攻撃が極めて効果的であることが示され、耐性を高めるためには、ノイズの種類と文脈的意味の両方を考慮した防御メカニズムが必要であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。