Skip to main content
QUICK REVIEW

[論文レビュー] Protecting Your NLG Models with Semantic and Robust Watermarks

Tao Xiang, Chunlong Xie|arXiv (Cornell University)|Dec 10, 2021
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本稿では、自然言語生成(NLG)モデル向けに、意味的で害のないフレーズペアを水性として使用するブラックボックス水性化方式を提案する。意味的な組み合わせパターンを用いてモデルの注目メカニズムを誘導することで、性能に影響を与えることなく水性を埋め込むことにより、微調整、転移学習、モデル圧縮に対して高い耐性を示し、最先端のバックドア検出アルゴリズムによっても検出不能である。

ABSTRACT

Natural language generation (NLG) applications have gained great popularity due to the powerful deep learning techniques and large training corpus. The deployed NLG models may be stolen or used without authorization, while watermarking has become a useful tool to protect Intellectual Property (IP) of deep models. However, existing watermarking technologies using backdoors are easily detected or harmful for NLG applications. In this paper, we propose a semantic and robust watermarking scheme for NLG models that utilize unharmful phrase pairs as watermarks for IP protection. The watermarks give NLG models personal preference for some special phrase combinations. Specifically, we generate watermarks by following a semantic combination pattern and systematically augment the watermark corpus to enhance the robustness. Then, we embed these watermarks into an NLG model without misleading its original attention mechanism. We conduct extensive experiments and the results demonstrate the effectiveness, robustness, and undetectability of the proposed scheme.

研究の動機と目的

  • モデルの動作を妨げることなく、効果的で非侵襲的なNLGモデル向け水性化技術の不足を解消すること。
  • 水性が通常のテキストと区別がつかないよう、意味的に整合性があり、検出を回避できるようにすること。
  • 微調整、転移学習、圧縮などのモデル変更に対しても、水性が検証可能であることを保証すること。
  • 既存のバックドア検出アルゴリズムによる検出を回避できる水性化アプローチを開発すること。

提案手法

  • モデルの注目を特定の意味的意味のある出力に向けるために、接頭語フレーズとキーフレーズのペアを用いる意味的組み合わせパターン(SCP)を導入する。
  • SCPに従って水性サンプルを生成することで、意味的整合性を保ちつつ注目メカニズムへの干渉を最小限に抑える。
  • モデルの変更やデータのシフトに対して耐性を高めるために、水性コーパスを体系的に拡張する。
  • 元のモデルの注目パターンや標準的タスクにおける性能を変更せずに、学習中に水性を埋め込む。
  • ブラックボックス水性化を採用し、モデルパラメータのアクセスを必要とせず、入力-出力ペアでの検証が可能である。
  • 検出不能性は、AUCを指標として、3つのバックドア検出アルゴリズム(ONION、編集距離、BERTScore)を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1既存の検出手法によって検出不能であり、意味的に整合性のあるNLGモデル向けの水性化方式を設計できるか?
  • RQ2微調整や転移学習といった一般的なモデル変更に対して、水性はどの程度耐性を示すか?
  • RQ3水性化方式は、標準的NLPタスクにおける元のモデル性能をどの程度維持するか?
  • RQ4モデル圧縮やパラメータ更新の後でも、水性は信頼性を持って検証可能か?

主な発見

  • 転移学習後、IWSLT14データセットにおけるBLEUスコアが28.59を維持しており、モデル性能の強い保持が示された。
  • 転移学習後、IWSLT14ではWESR(水性抽出成功確率)が0.96、OpenSubtitles12では0.79を達成し、高い検証可能性を示した。
  • WMT17翻訳ベンチマークでは、3つの検出アルゴリズム(ONION、編集距離、BERTScore)のAUC値がそれぞれ0.0287、0.0179、0.0280であった。これはほぼランダムな検出性能を示しており、検出不能性が裏付けられた。
  • 対話生成タスクでは、検出アルゴリズムのAUC値がONIONで0.4156、編集距離で0.5715、BERTScoreで0.2319であった。これは水性の信頼できる検出が不可能であることを示唆している。
  • 最大100%のトレーニングデータを用いた微調整後でも、水性は検証可能であり、強い耐性を示した。
  • 水性は意味的に通常のテキストと区別がつかず、多様なコーパスにおいて低検出性と一貫性のある性能を示しており、その証拠となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。