Skip to main content
QUICK REVIEW

[논문 리뷰] Protecting Your NLG Models with Semantic and Robust Watermarks

Tao Xiang, Chunlong Xie|arXiv (Cornell University)|2021. 12. 10.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 자연어 생성(NLG) 모델용 블랙박스 워터마킹 기법을 제안하며, 의미적으로 유의미하고 손상되지 않는 어휘 쌍을 워터마크로 사용한다. 의미적 조합 패턴을 통해 모델의 주의를 유도함으로써 성능에 영향을 주지 않으면서도 워터마크를 임베딩함으로써, 미세조정, 전이학습, 모델 압축에 대해 높은 강건성을 확보하였으며, 최신 백도어 탐지 알고리즘으로서도 탐지되지 않는다.

ABSTRACT

Natural language generation (NLG) applications have gained great popularity due to the powerful deep learning techniques and large training corpus. The deployed NLG models may be stolen or used without authorization, while watermarking has become a useful tool to protect Intellectual Property (IP) of deep models. However, existing watermarking technologies using backdoors are easily detected or harmful for NLG applications. In this paper, we propose a semantic and robust watermarking scheme for NLG models that utilize unharmful phrase pairs as watermarks for IP protection. The watermarks give NLG models personal preference for some special phrase combinations. Specifically, we generate watermarks by following a semantic combination pattern and systematically augment the watermark corpus to enhance the robustness. Then, we embed these watermarks into an NLG model without misleading its original attention mechanism. We conduct extensive experiments and the results demonstrate the effectiveness, robustness, and undetectability of the proposed scheme.

연구 동기 및 목표

  • 모델 행동을 방해하지 않는 효과적이고 비침습적인 워터마킹 기법의 부족을 해결하기 위해.
  • 워터마크가 의미적으로 일관되며 일반 텍스트와 구분되지 않도록 하여 탐지 방지하기 위해.
  • 미세조정, 전이학습, 압축과 같은 모델 수정에도 불구하고 워터마크가 검증 가능하도록 보장하기 위해.
  • 기존 백도어 탐지 알고리즘에 의해 탐지되지 않는 워터마킹 접근법 개발하기 위해.

제안 방법

  • 모델의 주의를 특정 의미적인 출력으로 유도하기 위해 접두어 어휘와 핵심 어휘를 쌍으로 조합하는 의미적 조합 패턴(Semantic Combination Pattern, SCP)을 도입한다.
  • 워터마크 샘플은 SCP를 따르며 의미적 일관성과 주의 메커니즘에 대한 최소한의 영향을 보장한다.
  • 모델 수정 및 데이터 이동에 대한 강건성을 향상시키기 위해 워터마크 코퍼스를 체계적으로 증강한다.
  • 기존 주의 패턴이나 표준 작업 성능에 영향을 주지 않도록 훈련 중에 워터마크를 임베딩한다.
  • 모델 파라미터에 대한 접근 없이도 입력-출력 쌍만으로도 검증이 가능한 블랙박스 워터마킹을 사용한다.
  • 불가지각성은 ONION, 편집 거리, BERTScore 세 가지 백도어 탐지 알고리즘을 대상으로 AUC를 지표로 사용해 평가한다.

실험 결과

연구 질문

  • RQ1기존 탐지 방법에 의해 탐지되지 않으며 의미적으로 일관된 워터마킹 기법을 NLG 모델에 적용할 수 있는가?
  • RQ2워터마킹은 일반적인 모델 수정, 예를 들어 미세조정 및 전이학습에 대해 얼마나 강건한가?
  • RQ3워터마킹 기법은 표준 NLP 작업에서 원본 모델의 성능을 어느 정도 유지하는가?
  • RQ4모델 압축 또는 파rameter 업데이트 이후에도 워터마크를 신뢰성 있게 검증할 수 있는가?

주요 결과

  • 전이학습 이후 IWSLT14 데이터셋에서 BLEU 점수가 28.59를 유지하여 모델 성능이 잘 보존됨을 확인하였다.
  • 전이학습 이후 IWSLT14에서 WESR(Watermark Extraction Success Rate)가 0.96, OpenSubtitles12에서 0.79를 기록하여 높은 검증 가능성 확보.
  • WMT17 번역 벤치마크에서 세 탐지 알고리즘(ONION, 편집 거리, BERTScore)의 AUC 값은 각각 0.0287, 0.0179, 0.0280이었으며, 거의 무작위 탐지 성능임을 시사.
  • 대화 생성 작업에서 탐지 알고리즘의 AUC 값은 ONION이 0.4156, 편집 거리가 0.5715, BERTScore가 0.2319였으며, 워터마크가 신뢰성 있게 탐지되지 않음을 의미.
  • 최대 100%의 훈련 데이터로 미세조정을 거친 후에도 워터마크가 검증 가능하여 강력한 강건성을 입증.
  • 다양한 코퍼스에서 일관된 성능과 낮은 탐지 가능성으로 인해 워터마크가 일반 텍스트와 의미적으로 구분되지 않음을 입증.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.