Skip to main content
QUICK REVIEW

[論文レビュー] RS-Del: Edit Distance Robustness Certificates for Sequence Classifiers via Randomized Deletion

Zhuoqun Huang, Neil G. Marchant|arXiv (Cornell University)|Jan 31, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、置換、挿入、削除を含む編集距離に基づく攻撃に対して、シーケンス分類器の耐性を保証するためのランダムスムージング手法であるRS-Delを提案する。本手法は、標準的なNeyman-Pearsonフレームワークに代わる、最長共通部分列に基づく新しい証明を用いる。MalConvにおいて、編集距離半径128バイトで91%の保証された正答率を達成した。

ABSTRACT

Randomized smoothing is a leading approach for constructing classifiers that are certifiably robust against adversarial examples. Existing work on randomized smoothing has focused on classifiers with continuous inputs, such as images, where $\ell_p$-norm bounded adversaries are commonly studied. However, there has been limited work for classifiers with discrete or variable-size inputs, such as for source code, which require different threat models and smoothing mechanisms. In this work, we adapt randomized smoothing for discrete sequence classifiers to provide certified robustness against edit distance-bounded adversaries. Our proposed smoothing mechanism randomized deletion (RS-Del) applies random deletion edits, which are (perhaps surprisingly) sufficient to confer robustness against adversarial deletion, insertion and substitution edits. Our proof of certification deviates from the established Neyman-Pearson approach, which is intractable in our setting, and is instead organized around longest common subsequences. We present a case study on malware detection--a binary classification problem on byte sequences where classifier evasion is a well-established threat model. When applied to the popular MalConv malware detection model, our smoothing mechanism RS-Del achieves a certified accuracy of 91% at an edit distance radius of 128 bytes.

研究の動機と目的

  • ソースコード やバイナリ実行可能ファイルなどの離散的で可変長のシーケンス入力に対する保証された耐性手法の不足に対処すること。
  • 挿入、削除、置換を含む編集距離に基づく攻撃者に対する耐性証明フレームワークを構築すること。
  • スムージング機構と解析を単純化するために、ランダムな削除のみを用いた効率的で整合性のある証明を可能にすること。
  • 特にマルウェア検出のような高リスクな状況において、耐性と正答率のバランスを調整できるチューナブルな意思決定閾値を可能にすること。
  • オラクルクエリアクセスを介して任意のベース分類器と互換性を持つスケーラブルで実用的な証明手法を提供すること。

提案手法

  • 入力シーケンスにランダムな削除を適用することで滑らかな分類器を構築する、RS-Delと呼ばれるランダムスムージング機構を提案する。
  • 滑らかにされた空間における信頼度スコアの上限を定めるために、入力とその摂動を加えたバージョンとの間の最長共通部分列(LCS)を基準点として用いる。
  • 摂動の間でもLCSが一貫している確率に基づいて、耐性保証の境界を導出する。
  • この設定では実行不可能な標準的なNeyman-Pearsonフレームワークに代わる、LCSに基づく信頼度境界に焦点を当てた新しい証明構造を採用する。
  • 与えられた入力と信頼度閾値に対して、最大の保証可能な編集距離半径を効率的に計算するために二分探索を用いる。
  • 特に攻撃者が悪意のあるサンプルを誤分類しようとする強い動機を持つ状況において、耐性半径と誤分類率のトレードオフを調整できるチューナブルな意思決定閾値をサポートする。

実験結果

リサーチクエスチョン

  • RQ1ランダムな削減のみに依存するスムージング機構が、置換、挿入、削除を含むすべての種類の編集操作に対するアドバーシャル編集に対して、シーケンス分類器の保証された耐性を提供できるか。
  • RQ2標準的なNeyman-Pearsonフレームワークに依存せずに、編集距離耐性のための実行可能な証明手法を導出できるか。
  • RQ3RS-Delの認証半径と信頼度境界は、ランダムアブレーションなどの既存手法と比較して、どのように優れているか。
  • RQ4RS-Delは、実世界のシーケンス分類タスク、特に高い実用的正答率を求めるマルウェア検出タスクにどの程度適用可能か。
  • RQ5最長共通部分列の使用が、従来のハミング距離に基づくアプローチよりも、よりタイトで効率的な耐性証明を可能にするか。

主な発見

  • RS-Delは、MalConvマルウェア検出モデルにおいて、編集距離半径128バイトで91%の保証された正答率を達成した。
  • 本手法は、スムージングプロセスにおいてランダムな削除のみを用いるにもかかわらず、置換、挿入、削除の3種類すべての編集操作に対して保証された耐性を提供する。
  • 最長共通部分列に基づく証明により、この設定では実行不可能な標準的なNeyman-Pearsonアプローチよりもタイトな信頼度境界が得られた。
  • 論文内で形式的な比較を通じて、RS-Delはランダムアブレーションを上回る認証のタイトネスを示した。
  • 本手法は効率的で実用的であり、ベース分類器へのオラクルアクセスのみを必要とし、長大なシーケンスに対してもスケーラブルな認証を可能にした。
  • チューナブルな意思決定閾値の使用により、特に高リスクな分類タスクにおいて耐性と正答率の有効なトレードオフが実現可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。