Skip to main content
QUICK REVIEW

[論文レビュー] "Nice Try, Kiddo": Ad Hominems in Dialogue Systems.

Emily Sheng, Kai-Wei Chang|arXiv (Cornell University)|Oct 26, 2020
Hate Speech and Cyberbullying Detection参考文献 34被引用数 4
ひとこと要約

本稿は、マイノリティコミュニティ(#BlackLivesMatter、#MeToo)に関するTwitter討論と、それ以外のトピック(#Vegan、#WFH)に関する人間の反応および対話システムの応答におけるアドホミネム攻撃を特定・分類する。DialoGPTなどのモデルにおけるアドホミネム生成を低減するため、顕著なn-gram類似度を用いた制約付きデコード手法を提案し、トレーニングデータの構成とデコード制約が有毒な応答を顕著に低減することを示している。

ABSTRACT

Ad hominem attacks are those that attack some feature of a person's character instead of the position the person is maintaining. As a form of toxic and abusive language, ad hominems contain harmful language that could further amplify the skew of power inequality for marginalized populations. Since dialogue systems are designed to respond directly to user input, it is important to study ad hominems in these system responses. In this work, we propose categories of ad hominems that allow us to analyze human and dialogue system responses to Twitter posts. We specifically compare responses to Twitter posts about marginalized communities (#BlackLivesMatter, #MeToo) and other topics (#Vegan, #WFH). Furthermore, we propose a constrained decoding technique that uses salient $n$-gram similarity to apply soft constraints to top-$k$ sampling and can decrease the amount of ad hominems generated by dialogue systems. Our results indicate that 1) responses composed by both humans and DialoGPT contain more ad hominems for discussions around marginalized communities versus other topics, 2) different amounts of ad hominems in the training data can influence the likelihood of the model generating ad hominems, and 3) we can thus carefully choose training data and use constrained decoding techniques to decrease the amount of ad hominems generated by dialogue systems.

研究の動機と目的

  • マイノリティコミュニティに関する議論に対する人間およびモデル生成応答におけるアドホミネム攻撃の頻度を分析すること。
  • トレーニングデータの構成が、対話システムがアドホミネムを生成する傾向に与える影響を特定すること。
  • 入力との顕著なn-gram類似度に基づくソフト制約をトップ-kサンプリングに適用する制約付きデコード技術を開発し、対話システムにおけるアドホミネム生成を低減すること。
  • 特にマイノリティアイデンティティに関連するトピックと比較して、アドホミネムの頻度を異なるトピック間で比較すること。
  • トップ-kサンプリングによるソフト制約が、応答生成における有毒言語を効果的に抑制できるかどうかを評価すること。

提案手法

  • 事前に定義された言語的および文脈的基準に従い、人間およびモデル応答におけるアドホミネムを分類すること。
  • 対照的分析のため、#BlackLivesMatter、#MeToo、#Vegan、#WFHに関するTwitter投稿および応答を収集・アノテートすること。
  • 入力との顕著なn-gram類似度に基づき、トップ-kサンプリングにソフト制約を適用する制約付きデコード手法を実装すること。
  • n-gram類似度スコアを用いて、アドホミネムを生成する可能性の高い応答トークンをペナルティ付与または抑制すること。
  • アドホミネムコンテンツの割合を変化させたカスタマイズされたトレーニングデータでDialoGPTを微調整し、モデル行動を評価すること。
  • 自動指標と人間評価の両方を用いて、アドホミネム生成の低減を測定する。

実験結果

リサーチクエスチョン

  • RQ1対話システムは、マイノリティコミュニティに関する議論に対して、それ以外のトピックよりも多くのアドホミネムを生成するか?
  • RQ2トレーニングデータに含まれるアドホミネムの割合が、モデルが同様の攻撃を生成する傾向にどのように影響するか?
  • RQ3入力とのn-gram類似度に基づく制約付きデコードは、対話システムにおけるアドホミネム生成を効果的に低減できるか?
  • RQ4人間の応答は、マイノリティコミュニティに関する議論において、それ以外のトピックよりもアドホミネムを含む可能性が高いか?
  • RQ5データキュレーションとデコード制約を用いることで、モデル行動をどれほど有毒な応答から回避させられるか?

主な発見

  • 人間およびDialoGPTの応答は、#BlackLivesMatterおよび#MeTooに関する議論において、#Veganおよび#WFHよりも顕著に多くのアドホミネムを含む。
  • トレーニングデータにアドホミネムの割合が高いほど、モデルが同様の攻撃を生成する可能性が高まる。
  • 提案された制約付きデコード手法は、トップ-kサンプリングに顕著なn-gram類似度に基づくソフト制約を適用することで、アドホミネム生成を低減した。
  • この手法は、応答のなめらかさや一貫性を損なわせることなく、有毒言語を効果的に抑制した。
  • モデル行動はトレーニングデータの構成に敏感であることが示され、データキュレーションが有害な出力を緩和できる可能性を示している。
  • 人間およびモデルの両方の応答は、マイノリティアイデンティティを含む議論において、系としてより多くのアドホミネムを生成する傾向を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。