Skip to main content
QUICK REVIEW

[論文レビュー] Multi-target Backdoor Attacks for Code Pre-trained Models

Yanzhou Li, Shangqing Liu|arXiv (Cornell University)|Jun 14, 2023
Software Engineering Research被引用数 5
ひとこと要約

本稿は、コードの事前学習モデル向けに、最初のタスクに依存しないマルチターゲットバックドア攻撃フレームワークを提案する。このフレームワークは、汚染されたSeq2Seqおよびトークン表現学習を用いて、事前学習段階で隠れ背後を埋め込むことを可能にし、5つのコード関連の下流タスクにおいても高い攻撃成功率(最大98.7%)を達成する。同時に、モデルの機能を保持し、既存の防御を回避する。

ABSTRACT

Backdoor attacks for neural code models have gained considerable attention due to the advancement of code intelligence. However, most existing works insert triggers into task-specific data for code-related downstream tasks, thereby limiting the scope of attacks. Moreover, the majority of attacks for pre-trained models are designed for understanding tasks. In this paper, we propose task-agnostic backdoor attacks for code pre-trained models. Our backdoored model is pre-trained with two learning strategies (i.e., Poisoned Seq2Seq learning and token representation learning) to support the multi-target attack of downstream code understanding and generation tasks. During the deployment phase, the implanted backdoors in the victim models can be activated by the designed triggers to achieve the targeted attack. We evaluate our approach on two code understanding tasks and three code generation tasks over seven datasets. Extensive experiments demonstrate that our approach can effectively and stealthily attack code-related downstream tasks.

研究の動機と目的

  • 広く利用可能な事前学習コードモデルがバックドア攻撃に対して脆弱であるというセキュリティ上の課題を解決すること。
  • コード理解およびコード生成タスクの両方をサポートする、タスクに依存しないバックドアフレームワークを構築すること。
  • コードの意味を保持し、静的解析を回避できるように、隠れトリガーを設計すること。
  • 再訓練なしに、多様な下流タスクでバックドアを活性化できること。
  • 攻撃の有効性、隠れ性、および既存の防御に対する耐性を評価すること。

提案手法

  • エンコーダ・デコーダモデルの事前学習段階にバックドアを埋め込む、汚染された事前学習戦略を提案する。
  • 特定の出力ベクトルをトリガー付き入力に割り当てる仕組みを設計し、コード分類タスクを標的とする汚染されたトークン表現学習戦略を構築する。
  • 文の挿入、削除、または演算子の変更によって出力シーケンスを変更することで、コード生成タスクを標的とする汚染されたSeq2Seq学習戦略を開発する。
  • コードと自然言語トークンを組み合わせたハイブリッドトリガーを用い、構文的正しさを維持するとともに検出を回避する。
  • 両方の事前学習戦略を統合し、理解および生成タスクの両方を標的とする統一されたフレームワークを構築する。
  • 7つのデータセットを用いて、5つの下流タスクでバックドアモデルを評価し、機能性、攻撃成功率、および隠れ性を検証する。

実験結果

リサーチクエスチョン

  • RQ1コードモデルの事前学習段階で、下流タスクにおけるマルチターゲット攻撃を可能にするバックドアを効果的に埋め込むことができるか?
  • RQ2提案された攻撃は、コード理解およびコード生成タスクの両方をどれほど効果的に損なうのか?
  • RQ3バックドアモデルは、静的解析および既存の防御手法によってどれほど検出を回避できるのか?
  • RQ4バックドアモデルは、健全な入力に対して元のモデルの機能をどれほど保持しているのか?
  • RQ5モデルがトークン表現ではなく直接ラベル生成を行う場合、攻撃の限界は何か?

主な発見

  • 提案されたバックドア攻撃は、複数のデータセットにおいて、コード生成タスクで最大98.7%、コード理解タスクで97.3%の攻撃成功率を達成した。
  • バックドアを埋め込んだモデルは、健全な性能を維持しており、重み再初期化防御後でも正確一致スコアがわずかに低下するにとどまり(例:Java2C#では66.70から56.90に)、高い性能を維持した。
  • 攻撃は隠れ性が高く、コードアナライザーによる検出を回避し、重み再初期化を含む一般的な防御技術に対しても耐性を示した。
  • 健全な入力に対して元のモデルの機能が保持されており、全評価データセットで精度の低下が最小限に抑えられた。
  • モデルが直接ラベル生成を行う場合、攻撃は効果を発揮しなかった。これは、アーキテクチャ上の重要な制限を示している。
  • 事後処理およびモデル署名が、バックドアを含むモデルのデプロイリスクを低減する有効な緩和戦略であると特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。