[論文レビュー] PETGEN: Personalized Text Generation Attack on Deep Sequence Embedding-based Classification Models
PETGEN は、ユーザー履歴、ライティングスタイル、トピカルな関連性を活用して、深層学習ベースのユーザーシーケンス分類モデルを回避する、エンドツーエンドの敵対的テキスト生成フレームワークである。PETGEN は、Yelp および Wikipedia データセット上で、5 つのベースラインと比較して、より高品質で現実的であるテキストを生成しながら、分類器の性能を顕著に低下させ、F1 スコアを最低に抑え、攻撃成功確率を最大にする。
What should a malicious user write next to fool a detection model? Identifying malicious users is critical to ensure the safety and integrity of internet platforms. Several deep learning-based detection models have been created. However, malicious users can evade deep detection models by manipulating their behavior, rendering these models of little use. The vulnerability of such deep detection models against adversarial attacks is unknown. Here we create a novel adversarial attack model against deep user sequence embedding based classification models, which use the sequence of user posts to generate user embeddings and detect malicious users. In the attack, the adversary generates a new post to fool the classifier. We propose a novel end-to-end Personalized Text Generation Attack model, called PETGEN, that simultaneously reduces the efficacy of the detection model and generates posts that have several key desirable properties. Specifically, PETGEN generates posts that are personalized to the user's writing style, have knowledge about a given target context, are aware of the user's historical posts on the target context, and encapsulate the user's recent topical interests. We conduct extensive experiments on two real-world datasets (Yelp and Wikipedia, both with ground-truth of malicious users) to show that PETGEN significantly reduces the performance of popular deep user sequence embedding-based classification models. PETGEN outperforms five attack baselines in terms of text quality and attack efficacy in both white-box and black-box classifier settings. Overall, this work paves the path towards the next generation of adversary-aware sequence classification models.
研究の動機と目的
- 深層ユーザーシーケンス埋め込みに基づく分類モデルが、テキスト生成による敵対的攻撃に対してどれほど脆弱であるかを調査すること。
- ユーザーのライティングスタイル、履歴行動、最近の関心に合わせてパーソナライズされた投稿を生成する手法を開発すること。
- シーケンスベースの分類器を効果的にだます一方で、高品質なテキストと文脈的関連性を維持するテキスト生成攻撃を構築すること。
- 実世界のデータセットを用いて、現実的な敵対的条件下での既存の検出モデルの頑健性を評価すること。
提案手法
- PETGEN は、ユーザー履歴、ターゲット文脈、最近の投稿を条件として、エンドツーエンドのシーケンス・トゥ・シーケンスのテキスト生成モデルを採用している。
- 生成されたテキストがユーザーのライティングスタイルとトピカルな関心と一致するよう、文脈に配慮したジェネレータを統合している。
- 攻撃成功度、スタイル類似度、文脈的関連性を組み合わせたマルチタスク学習目的関数を用いて、投稿生成を最適化している。
- 履歴投稿の関連性を捉え、文脈的一致性を向上させるために、シーケンスに配慮したアテンションメカニズムを組み込んでいる。
- 分類器の F1 スコアを最小限に抑えつつ、テキスト品質とパーソナライズ度を最大化する制約付き最適化問題として攻撃を定式化している。
- PETGEN は、悪意あるユーザーの真のラベルを用いて、Yelp および Wikipedia の2つの実世界データセット上で訓練および評価されている。
実験結果
リサーチクエスチョン
- RQ1PETGEN は、ホワイトボックスおよびブラックボックスの両設定において、深層ユーザーシーケンス分類モデルの F1 スコアをどの程度低下させることができるか?
- RQ2PETGEN は、ユーザーのライティングスタイルおよび最近の関心にどの程度パーソナライズされたテキストを生成できるか?
- RQ3テキスト品質および攻撃成功確率の観点から、PETGEN は既存の攻撃ベースラインと比べてどの程度優れているか?
- RQ4生成された投稿のセンチメントは、元のユーザー投稿とどの程度一貫性があるか?
- RQ5PETGEN の性能向上に寄与している主な構成要素は何か?
主な発見
- PETGEN は、Yelp データセットにおけるフェイクレビューエスカレーションモデルの F1 スコアを、すべての手法の中で最低にまで低下させ、最高の攻撃成功確率を達成した。
- PETGEN は、すべてのベースラインの中で最高の BLEU スコア(4.2)とターゲット文脈類似度(0.68)を達成しており、優れたテキスト品質と関連性を示している。
- 人間による評価では、PETGEN が生成した投稿の 58.33% が、最先端のベースラインである Malcom よりもより現実的であると判断された。
- PETGEN が生成した投稿の 70.8% が、元のユーザー投稿と同じセンチメント極性を維持しており、ユーザー行動と一貫性があることが確認された。
- アブレーションスタディの結果、攻撃目的、スタイルモデリング、文脈的関連性のすべてのコンポonent が、攻撃効果およびテキスト品質の向上に顕著に寄与していることが確認された。
- PETGEN は、ホワイトボックスおよびブラックボックスの両設定において、5 つのベースラインをすべての指標で上回り、優れた一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。