[論文レビュー] Generating Adversarial Examples in Chinese Texts Using Sentence-Pieces
本稿では、文書-pieceトークン化と事前学習済みマスキング言語モデルを置換生成子として用い、中国語テキスト向けのピースレベルの敵対的サンプル生成手法を提案する。部分語素レベルでの自然で流暢な敵対的サンプルを生成することで、意味的整合性と文の流れを保ちつつ、高い攻撃成功率を達成し、文脈的・人間評価において、文字レベルおよび語レベルの手法を上回る品質を実現した。
Adversarial attacks in texts are mostly substitution-based methods that replace words or characters in the original texts to achieve success attacks. Recent methods use pre-trained language models as the substitutes generator. While in Chinese, such methods are not applicable since words in Chinese require segmentations first. In this paper, we propose a pre-train language model as the substitutes generator using sentence-pieces to craft adversarial examples in Chinese. The substitutions in the generated adversarial examples are not characters or words but extit{'pieces'}, which are more natural to Chinese readers. Experiments results show that the generated adversarial samples can mislead strong target models and remain fluent and semantically preserved.
研究の動機と目的
- 語の境界が曖昧な中国語テキストにおいて、文法的整合性を損なわず、高品質な敵対的サンプルを生成する課題に対処すること。
- 中国語NLPにおける従来の語または文字レベルの置換手法の限界を克服し、部分語素レベル(ピースレベル)の置換戦略を導入すること。
- 文書-pieceトークン化を用いて事前学習したマスキング言語モデルを構築し、意味的に整合的で流暢な敵対的サンプルを生成すること。
- 意味的整合性と人間の読みやすさを保ちながら、強力なBERTベースのモデルを攻撃するピースレベルの敵対的サンプルの有効性を評価すること。
提案手法
- 大規模な中国語テキストを用いて、文書-pieceトークン化を適用し、部分語素単位を捉えるピースレベルの語彙を学習するためのマスキング言語モデルを訓練する。
- 事前学習済みモデルを置換生成子として用い、文字レベルや語レベルではなく、ピースレベルでの候補置換を生成する。
- 入力テキスト内の特定のピースを置換することで敵対的サンプルを生成する際、ターゲットモデルを誤検出させる一方で、文の流れと意味を保持する。
- ターゲットモデルのアーキテクチャが不明なブラックボックス攻撃設定を採用し、予測スコアのみを用いて攻撃を誘導する。
- 攻撃プロセス中に、事前学習済み埋め込みとのコサイン類似度を用いて、高品質な候補置換をフィルタリングする。
- 人間による評価を実施し、文の流れとラベルの保持状態を評価することで、敵対的サンプルが自然で意味的に整合的であることを確認する。
実験結果
リサーチクエスチョン
- RQ1文書-pieceトークン化を用いたピースレベルの置換は、中国語テキストにおいて、文字レベルや語レベルの手法に比べ、より流暢で意味的整合性を保った敵対的サンプルを生成できるか?
- RQ2文書-pieceトークンで学習した事前学習済みマスキング言語モデルは、中国語テキスト分類モデル向けに高品質な敵対的置換を生成するのにどの程度有効か?
- RQ3候補置換リストのサイズと、生成された敵対的サンプルの品質(文の流れ、意味的整合性)とのトレードオフはいかほどか?
- RQ4ピースレベルの敵対的サンプルは、多様な中国語NLPタスクにおける強力で微調整済みのBERTベースのモデルをどの程度効果的に攻撃できるか?
主な発見
- 提案手法のピースレベル敵対的攻撃は、IflyTekで11.0%、Weiboで35.0%、Sogouで18.5%、Law34で12.0%の攻撃成功率を達成し、文の流れと意味的整合性の観点で、文字レベルおよび語レベルのベースラインを上回った。
- 人間評価では、IflyTekで94%、Weiboで90%、Sogouで93%、Law34で97%の敵対的サンプルが正しくラベルを特定しており、優れたラベル保持性を示した。
- 生成された敵対的サンプルの平均文の流れスコアは、IflyTekで4.5、Weiboで4.2、Sogouで4.2、Law34で4.8であり、文字レベル手法に比べ顕著に高かった。
- わずかに攻撃成功率が低くても、ピースレベル手法は文字レベルおよび語レベルのベースラインに比べ、より高い文の流れと意味的整合性を実現しており、敵対的サンプルの品質が優れていることが示された。
- トレードオフ曲線から、候補リストのサイズを増やすことで攻撃成功率が向上することが確認されたが、ピースレベル手法は中程度のリストサイズでも高い文の流れと意味的整合性を維持していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。