Skip to main content
QUICK REVIEW

[論文レビュー] Learning from data in the mixed adversarial non-adversarial case: Finding the helpers and ignoring the trolls

Da Young Ju, Jing Xu|arXiv (Cornell University)|Aug 5, 2022
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

本稿では、トロールが有毒または誤解を招く入力を提供する混合の悪意あるおよび非悪意ある設定において、人間フィードバックからのモデル学習を改善するユーザーレベルのロバストな学習手法を提案する。繰り返し悪質な行動をとるユーザーを集約されたユーザ行動から特定することで、Soft PURRのようなユーザベースの手法が、新しいベンチマーク(SafetyMix)および実際のデプロイメントデータにおいて、例ベースの手法よりも優れたロバスト性とトロール検出を示す。

ABSTRACT

The promise of interaction between intelligent conversational agents and humans is that models can learn from such feedback in order to improve. Unfortunately, such exchanges in the wild will not always involve human utterances that are benign or of high quality, and will include a mixture of engaged (helpers) and unengaged or even malicious users (trolls). In this work we study how to perform robust learning in such an environment. We introduce a benchmark evaluation, SafetyMix, which can evaluate methods that learn safe vs. toxic language in a variety of adversarial settings to test their robustness. We propose and analyze several mitigating learning algorithms that identify trolls either at the example or at the user level. Our main finding is that user-based methods, that take into account that troll users will exhibit adversarial behavior across multiple examples, work best in a variety of settings on our benchmark. We then test these methods in a further real-life setting of conversations collected during deployment, with similar results.

研究の動機と目的

  • 会話型AIにおける現実世界の人間フィードバックから学ぶ課題に取り組むこと。この際、高品質な支援者と悪意あるまたは低品質なトロールが共存する状況を想定する。
  • 継続的学習中にモデル性能を体系的に劣化させる悪意あるユーザ行動の特定と緩和を行うこと。
  • マスタートロール、安全/不安全なラベルラー、ガスライト・トロールなどの多様な悪意あるユーザ行動パターンを想定した、ロバストな学習手法を体系的に評価可能なベンチマーク、SafetyMixを構築すること。
  • 複数の相互作用にわたる行動を考慮するユーザーレベルの信頼モデリングが、例レベルの手法に比べてロバスト性を向上させるかどうかを検証すること。
  • BlenderBot 3の実際のデプロイメントデータを用いて、合成ベンチマークを越えた実用的妥当性を確認すること。

提案手法

  • 実際の入力データを用い、人工的に悪意あるノイズパターンを注入することで、マスタートロール、ガスライト・トロールなど多様なトロール行動をシミュレートする合成ベンチマーク、SafetyMixを提案する。
  • 3つのユーザベースの検出手法を設計:ユーザ単位での削除、ユーザ+例単位での削除、およびソフトユーザーレベルのロバスト削除(Soft PURR)。Soft PURRは複数の例にわたるユーザ行動を統合的に評価する。
  • 標準的な例レベルのロバスト学習手法(例レベルの削除やロバスト損失関数など)と比較して、これらのユーザベース手法を実装および比較する。
  • Soft PURRを実装する。これは、例レベルの予測を集約して各ユーザに信頼スコアを割り当てる微分可能でソフトなしきい値処理を採用し、エンドツーエンドの学習を可能にする。
  • BlenderBot 3の実際の会話データを用いて、ユーザベース手法の性能を生産環境に近い条件で検証する。
  • クラウドワーカーによる人間評価を実施し、現実の状況下でのモデル性能およびトロール検出の正確性を検証する。

実験結果

リサーチクエスチョン

  • RQ1混合の人間フィードバック設定下で、ユーザベースの学習手法は例ベースの手法に比べて、悪意あるフィードバックの検出と緩和においてどのように異なるか?
  • RQ2ガスライト、一貫した毒性など、どのような種類のトロール行動が、現在のロバスト学習手法にとって最も検出が難しいか?
  • RQ3ユーザーレベルの信頼モデルは、合成データおよび現実世界のデータの両方において、モデルのロバスト性と学習効率をどの程度向上させるか?
  • RQ4ユーザベースの手法は、大規模な会話型エージェントを含む実際のデプロイメント環境に一般化可能か?
  • RQ5ガスライト・トロールのような洗練された悪意あるパターンに直面した際、現在のロバスト学習アルゴリズムの失敗モードは何か?

主な発見

  • ユーザベースの学習手法、特にSoft PURRは、SafetyMixベンチマークの全テスト設定において、例ベースの手法を一貫して上回る性能を示した。
  • ユーザベース手法と例ベース手法の性能差は、悪意あるノイズのレベルが高くなるほど拡大し、特にガスライト・トロールのような複雑なトロールタイプに対して顕著であった。
  • BlenderBot 3の実デプロイメントデータにおいて、ユーザベース手法は、クラウドワーカーによる評価を通じて、改善されたトロール検出の正確性を示した。
  • Soft PURRは、ユーザ行動の統合的評価を活用することで優れたロバスト性を達成し、理想化されたユーザ単位での削除に近い性能を達成した。
  • 例ベースの手法は、複数の相互作用にわたり毒性行動を示す継続的な悪意あるユーザを検出できなかったため、ユーザーレベルのモデリングの必要性が浮き彫りになった。
  • ベンチマークであるSafetyMixは、ガスライトやラベル反転攻撃パターン下で、既存手法の限界を効果的に露呈させ、今後の改善の余地があることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。