[論文レビュー] Open-sourced Dataset Protection via Backdoor Watermarking
本稿では、訓練データに隠しトリガーを埋め込むことで、第三者のモデルが保護されたデータセットで訓練されたかどうかを検証できるバックドア・ウォーターマーキング手法を提案する。この手法は、ウォーターマーキングにポisonsベースのバックドア攻撃(例:BadNets、Blended Attack)を用い、後方確率の仮説検定によりウォーターマーキングの存在を検出する。ベンチマークデータセット上で、モデル性能への影響を最小限に抑えながら100%の検出精度を達成した。
The rapid development of deep learning has benefited from the release of some high-quality open-sourced datasets ($e.g.$, ImageNet), which allows researchers to easily verify the effectiveness of their algorithms. Almost all existing open-sourced datasets require that they can only be adopted for academic or educational purposes rather than commercial purposes, whereas there is still no good way to protect them. In this paper, we propose a \emph{backdoor embedding based dataset watermarking} method to protect an open-sourced image-classification dataset by verifying whether it is used for training a third-party model. Specifically, the proposed method contains two main processes, including \emph{dataset watermarking} and \emph{dataset verification}. We adopt classical poisoning-based backdoor attacks ($e.g.$, BadNets) for dataset watermarking, ie, generating some poisoned samples by adding a certain trigger ($e.g.$, a local patch) onto some benign samples, labeled with a pre-defined target class. Based on the proposed backdoor-based watermarking, we use a hypothesis test guided method for dataset verification based on the posterior probability generated by the suspicious third-party model of the benign samples and their correspondingly watermarked samples ($i.e.$, images with trigger) on the target class. Experiments on some benchmark datasets are conducted, which verify the effectiveness of the proposed method.
研究の動機と目的
- オープンソースデータセットが第三者のモデルで使用されたかどうかを、訓練詳細にアクセスできない状況でも検証できる有効な手法の不足に対処すること。
- 学術利用に限定されることが一般的な高品質なオープンソースデータセットを、商用利用から保護すること。
- モデル性能に悪影響を及げず、検出に効果的で、攻撃者による検出を避けられるステルス性の高いウォーターマーキング方式を開発すること。
- 訓練詳細を必要とせず、データセット保護者が商用利用の不正を検証できるようにすること。
提案手法
- ウォーターマーキングは、ポisonsベースのバックドア攻撃(例:BadNets、Blended Attack)を用い、正常な画像のわずかな割合にトリガー(例:3×3の白い正方形または黒い線)を追加し、ターゲットクラスに再ラベル付けすることで実行される。
- トリガーは人間が認識できないように設計されており、ウォーターマーキングがステルス性を保ちつつ、正常なサンプルに対するモデルの精度を維持する。
- 不審なモデルにおいて、正常サンプルとウォーターマーキング済みサンプルのターゲットクラスにおける後方確率を比較するために仮説検定を適用する。
- 有意水準0.05で対応t検定を用い、後方確率の差が統計的に有意であるかどうかを判定することで、ウォーターマーキングの存在を特定する。
- ウォーターマーキング済みデータで訓練されたモデルは、ウォーターマーキング済みサンプルに対して正常サンプルよりも顕著に高い後方確率を示すという事実に依拠している。
- ウォーターマーキング率(γ)と可視性パラメータ(λ)は、効果性とステルス性のバランスを取るために調整されるハイパーパrameterである。
実験結果
リサーチクエスチョン
- RQ1訓練詳細にアクセスできない状況でも、バックドアベースのウォーターマーキング方式を用いて、第三者のモデルがオープンソースデータセットで訓練されたかどうかを検証できるか?
- RQ2本手法は、さまざまなベンチマークでウォーターマーキング済みデータセットで訓練されたモデルにおいて、ウォーターマーキングの存在をどの程度効果的に検出できるか?
- RQ3ウォーターマーキング率やトリガーの可視性を変化させた場合、ウォーターマーキングの効果性(例:WSR)とモデル性能(例:正常精度)のトレードオフはどの程度か?
- RQ4本手法の検証方法は、高い検出精度を維持しながら、どの程度のステルス性を保っているか?
主な発見
- 提案手法は、元のモデル性能から2%以内の正常精度を維持しており、強い無害性を示した。
- 5%のウォーターマーキング率で、CIFAR-10およびGTSRBの両データセットにおいて、ウォーターマーキング成功率(WSR)が90%を超えた。これは高い有効性を示している。
- 全テスト対象モデルおよびトリガーにおいて、成功検出比(RSD)が100%に達し、完全な検出能力を示した。
- WSRは、ウォーターマーキング率(γ)と可視性パラメータ(λ)の値が高くなるにつれて上昇し、検出可能性とステルス性の明確なトレードオフが確認された。
- ResNetおよびVGGの異なるアーキテクチャ、ラインおよび正方形の異なるトリガータイプにおいても、本手法は安定して有効であり、さまざまな設定に一般化可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。