Skip to main content
QUICK REVIEW

[論文レビュー] Why So Toxic? Measuring and Triggering Toxic Behavior in Open-Domain Chatbots

Wai Man Si, Michael Backes|arXiv (Cornell University)|Sep 7, 2022
Spam and Phishing Detection被引用数 7
ひとこと要約

この論文は、毒性のないクエリを生成してオープンドメインチャットボットの毒性応答を引き起こすGPT-2ベースの攻撃、ToxicBuddyを紹介する。毒性のない入力でも有害な出力を引き起こす可能性があり、クローズドワールド設定では最大23.47%、オープンワールド評価では10.7%の成功率を示し、チャットボットの安全性における深刻な脆弱性を露呈している。

ABSTRACT

Chatbots are used in many applications, e.g., automated agents, smart home assistants, interactive characters in online games, etc. Therefore, it is crucial to ensure they do not behave in undesired manners, providing offensive or toxic responses to users. This is not a trivial task as state-of-the-art chatbot models are trained on large, public datasets openly collected from the Internet. This paper presents a first-of-its-kind, large-scale measurement of toxicity in chatbots. We show that publicly available chatbots are prone to providing toxic responses when fed toxic queries. Even more worryingly, some non-toxic queries can trigger toxic responses too. We then set out to design and experiment with an attack, ToxicBuddy, which relies on fine-tuning GPT-2 to generate non-toxic queries that make chatbots respond in a toxic manner. Our extensive experimental evaluation demonstrates that our attack is effective against public chatbot models and outperforms manually-crafted malicious queries proposed by previous work. We also evaluate three defense mechanisms against ToxicBuddy, showing that they either reduce the attack performance at the cost of affecting the chatbot's utility or are only effective at mitigating a portion of the attack. This highlights the need for more research from the computer security and online safety communities to ensure that chatbot models do not hurt their users. Overall, we are confident that ToxicBuddy can be used as an auditing tool and that our work will pave the way toward designing more effective defenses for chatbot safety.

研究の動機と目的

  • 毒性のクエリまたは非毒性のクエリを提示された際、オープンドメインチャットボットがどの程度の割合で毒性応答を生成するかを調査すること。
  • 見た目は無害なクエリが、最先端のチャットボットにおいても毒性行動を引き起こす可能性があるかどうかを特定すること。
  • 非毒性のクエリを自動生成して毒性応答のトリガーを最大化するよう設計された攻撃、ToxicBuddyの開発および評価を行うこと。
  • こうした敵対的クエリに対する既存の防御メカニズムの有効性を評価すること。
  • チャットボットの展開における、改善された安全性の評価および防御戦略の緊急性を強調すること。

提案手法

  • BlenderBot(スモール)およびTwitterBotにおける過去の測定で、非毒性のクエリが毒性応答を引き起こしたデータをもとに、補助データセットを構築した。
  • この補助データセット上でGPT-2モデルを微調整し、毒性応答を引き起こすように設計された新しい非毒性クエリを生成するようにした。
  • 攻撃をクローズドワールド(測定で使用された同じモデル)およびオープンワールド(未知のモデル)の両設定で評価した。
  • クエリ埋め込みのクラスタリングと3-gramプレフィックスの統合により、トリガーの可能性を高める手法を導入し、攻撃成功率を向上させた。
  • クエリおよび応答の毒性を評価するためにGoogleのPerspective APIを用い、入力が非毒性であることを保証した。
  • 複数の公開チャットボットモデル(BlenderBot(ミディアム、ラージ)、DialoGPT、および元のモデル)における攻撃性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1どのような種類のクエリがオープンドメインチャットボットにおいて、毒性応答を引き起こしやすいか?
  • RQ2見た目は無害なクエリが、最先端のチャットボットにおいても、その純粋な性質にもかかわらず毒性応答を引き起こすことができるか?
  • RQ3自動攻撃が、非毒性のクエリを生成し、未確認のチャットボットモデルにおいても、信頼性高く毒性応答を引き起こすことができるか?
  • RQ4既存の防御メカニズムは、こうした攻撃をどれほど効果的に緩和できるか?
  • RQ5こうした攻撃は、感受性の高いアプリケーションにおけるチャットボットの安全性と展開にどのような意味を持つのか?

主な発見

  • 4chanデータセットの入力を使用した場合、BlenderBot(スモール)およびTwitterBotの約8%の応答が毒性を示した。
  • BlenderBot(スモール)の5.21%の毒性応答は、4chanの/pol/掲示板からの非毒性クエリによって引き起こされた。
  • クローズドワールド評価において、ToxicBuddyはTwitterBotに対して23.47%の非毒性から毒性への(NT2T)攻撃成功率を達成した。
  • オープンワールド設定では、ToxicBuddyはDialoGPTで10.7%、BlenderBot(ラージ)で10.57%、BlenderBot(ミディアム)で4.03%のケースで毒性応答を引き起こした。
  • 3-gramプレフィックスとクラスタリングの活用により、攻撃成功率はDialoGPTで10.7%、BlenderBot(ラージ)で10.57%に向上した。
  • 既存の防御メカニズムは、モデルの有用性を低下させるか、完全に攻撃を抑制できず、より強力な防御策の必要性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。