Skip to main content
QUICK REVIEW

[論文レビュー] COLD: A Benchmark for Chinese Offensive Language Detection

Jiawen Deng, Jingyan Zhou|arXiv (Cornell University)|Jan 16, 2022
Hate Speech and Cyberbullying Detection被引用数 7
ひとこと要約

本稿では、COLDataset(37,480件のラベル付コメントを含む)とCOLDetector(COLDataset上で微調整されたBERTベースの分類器)から構成される、中国語の攻撃的言語検出のためのベンチマークCOLDを紹介する。ベンチマークの結果から、攻撃的でない入力、特にバイアスに反する内容やグループ標的のプロンプトですら、中国語言語モデルで攻撃的生成を引き起こすことが判明し、実装における深刻なセキュリティリスクを浮き彫りにしている。

ABSTRACT

Offensive language detection is increasingly crucial for maintaining a civilized social media platform and deploying pre-trained language models. However, this task in Chinese is still under exploration due to the scarcity of reliable datasets. To this end, we propose a benchmark --COLD for Chinese offensive language analysis, including a Chinese Offensive Language Dataset --COLDATASET and a baseline detector --COLDETECTOR which is trained on the dataset. We show that the COLD benchmark contributes to Chinese offensive language detection which is challenging for existing resources. We then deploy the COLDETECTOR and conduct detailed analyses on popular Chinese pre-trained language models. We first analyze the offensiveness of existing generative models and show that these models inevitably expose varying degrees of offensive issues. Furthermore, we investigate the factors that influence the offensive generations, and we find that anti-bias contents and keywords referring to certain groups or revealing negative attitudes trigger offensive outputs easier.

研究の動機と目的

  • 中国語の攻撃的言語検出のための信頼できるデータセットと検出器の不足に対処すること。
  • 人気のある中国語生成言語モデルの攻撃的性を評価し、攻撃的出力を引き起こす要因を同定すること。
  • 攻撃的でない入力、例えばバイアスに反するプロンプトが、それでも攻撃的生成を引き起こすかどうかを調査すること。
  • 今後の中国語NLPにおける攻撃的言語研究のための標準化されたベンチマークを提供すること。
  • 見かけ上中立的または倫理的な内容のプロンプトでさえも見過ごされがちなセキュリティリスクについての認識を高めること。

提案手法

  • COLDatasetは、37,480件の中国語SNSコメントを、二値の攻撃的ラベルを付けて、部分的に自動化された手法と手動によるラベリングによって構築された。
  • テストセットには、洗練されたラベリング方式が適用され、攻撃的コンテンツは、個人攻撃、グループ攻撃、バイアスに反する内容、およびその他の攻撃的でないタイプに分類された。
  • COLDetectorは、COLDataset上で微調整されたBERT-base-Chineseモデルであり、ベースラインの攻撃的言語検出器として機能する。
  • ベンチマークは、CDialGPT、CPM、EVAの3つの代表的な中国語生成モデルにおける攻撃的生成リスクの評価に使用された。
  • 入力プロンプトを体系的に変化させ、グループ固有のキーワード、否定的態度表現、バイアスに反する言語などのトリガー要因を分析した。
  • 統計的分析により、異なる入力タイプ間での攻撃的出力率を比較し、高リスクのトリガー要因を同定した。

実験結果

リサーチクエスチョン

  • RQ1中国語生成言語モデルは、攻撃的でない、あるいはバイアスに反する内容のプロンプトを受け取った場合、どの程度攻撃的出力を生成するのか?
  • RQ2グループ標的のキーワードや否定的態度表現などの、どのような入力タイプが攻撃的生成を最も強く引き起こすのか?
  • RQ3COLDetectorは、既存の手法と比較して中国語の攻撃的言語検出においてどの程度の性能を示すのか?
  • RQ4COLDのようなベンチマークは、実装前に中国語言語モデルにおけるセキュリティリスクを同定・緩和するのを支援できるのか?
  • RQ5なぜ一部の攻撃的でない入力が、明示的に攻撃的な入力と同等の割合で攻撃的出力を引き起こすのか?

主な発見

  • 攻撃的でない入力、特にバイアスに反するプロンプトが、明示的に攻撃的な入力と同等の割合で攻撃的出力を引き起こすことが判明した。
  • 公平性を促進するバイアスに反するコンテンツは、埋め込まれたグループ固有のキーワードや否定的態度表現のため、攻撃的出力を引き起こしやすい。
  • COLDetectorはCOLDataset上で優れた性能を示し、本研究で提示されたベンチマーク上で微調整された場合、既存の手法を上回った。
  • ベンチマークの結果から、現在のデータセットでは文脈情報が捉えられていないことが判明し、今後の会話レベルの攻撃的言語検出のための研究の必要性が示された。
  • ベースラインモデルの性能は、データカバレッジとトレーニング技術の制限により限定的であり、より多様で洗練されたラベル付けにより改善の余地があることが示された。
  • 攻撃的でないが見かけ上倫理的中立的または肯定的と見なされる入力においても、セキュリティ上のリスクが見過ごされる可能性があることを強調しており、モデル評価における検出基準の拡大が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。