Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Multi-bit Natural Language Watermarking through Invariant Features

KiYoon Yoo, Wonhyuk Ahn|arXiv (Cornell University)|2023. 05. 03.
Advanced Steganography and Watermarking Techniques인용 수 5
한 줄 요약

이 논문은 키워드와 의존 구조와 같은 불변의 의미적 및 문법적 특징을 활용하여 일반적인 손상에 저항하는 방식으로 워터마크를 삽입하는 강건한 다비트 자연어 워터마킹 프레임워크를 제안한다. 손상에 강건한 보완 모델을 훈련하고 워터마크를 이러한 안정된 특징에 고정시킴으로써, 네 개의 데이터셋과 여러 가지 손상 유형 및 비율에서 이전 작업 대비 평균 16.8%포인트 향상된 강건성을 달성한다.

ABSTRACT

Recent years have witnessed a proliferation of valuable original natural language contents found in subscription-based media outlets, web novel platforms, and outputs of large language models. However, these contents are susceptible to illegal piracy and potential misuse without proper security measures. This calls for a secure watermarking system to guarantee copyright protection through leakage tracing or ownership identification. To effectively combat piracy and protect copyrights, a multi-bit watermarking framework should be able to embed adequate bits of information and extract the watermarks in a robust manner despite possible corruption. In this work, we explore ways to advance both payload and robustness by following a well-known proposition from image watermarking and identify features in natural language that are invariant to minor corruption. Through a systematic analysis of the possible sources of errors, we further propose a corruption-resistant infill model. Our full method improves upon the previous work on robustness by +16.8% point on average on four datasets, three corruption types, and two corruption ratios. Code available at https://github.com/bangawayoo/nlp-watermarking.

연구 동기 및 목표

  • 구독 미디어, 웹 소설, LLM 출력물과 같은 고가치 자연어 콘텐츠에 대한 저작권 보호의 증가하는 수요를 해결한다.
  • 높은 워터마크 용량을 삽입할 경우 저하되는 강건성 또는 품질 문제를 겪는 기존 워터마킹 기법의 한계를 극복한다.
  • 높은 워터마크 용량과 강력한 텍스트 손상에 대한 저항성 사이의 균형을 이루는 프레임워크를 개발한다.
  • 소량의 수정에도 안정적인 특징—예를 들어 키워드와 문법적 의존성 구조—를 식별하고 이를 활용한다.
  • 손상된 텍스트에 대해 명시적으로 훈련된 강건한 보완 모델을 설계하여 메시지 추출 시 워터마크의 무결성을 유지한다.

제안 방법

  • 기존 NLP 모델을 사용하여 텍스트 내에서 시각적으로 중요한 불변 특징—특히 키워드와 문법적 의존성 구성 요소—를 식별한다.
  • 이러한 불변 특징에 워터마크 삽입 위치를 고정시켜 소량의 손상이 발생하더라도 일관되고 신뢰할 수 있는 탐지가 가능하도록 한다.
  • 사전 훈련 단계에서 손상된 예시를 명시적으로 노출시켜 손상에 강건한 신경 보완 모델을 훈련시킨다.
  • 두 단계 워터마킹 파이프라인을 사용한다: 첫 번째로 불변 특징에 비트를 삽입하고, 두 번째로 유창성을 유지하기 위해 강건한 보완 모델을 사용해 텍스트를 재구성한다.
  • 문장 임베딩 기반 모델과 NLI 모델을 활용해 워터마크 삽입 순서를 지도함으로써 의미 품질을 향상시키고 아티팩트를 줄인다.
  • 보안 공격 기법을 사용해 악성 손상(예: 토큰 대체, 삭제)을 시뮬레이션하여 보완 모델을 실제 환경에서의 강건성에 대비해 훈련시킨다.
Figure 1: Leftmost shows an example of a cover text and its keyword and syntactic dependency components (only partially shown due to space constraint); Middle shows Phase 1 and Phase 2; Rightmost shows an example of a valid watermark sample.
Figure 1: Leftmost shows an example of a cover text and its keyword and syntactic dependency components (only partially shown due to space constraint); Middle shows Phase 1 and Phase 2; Rightmost shows an example of a valid watermark sample.

실험 결과

연구 질문

  • RQ1소량의 손상이 발생하더라도 자연어에서 워터마크 삽입의 안정적 기초가 될 수 있는 의미적 및 문법적 특징은 무엇인가?
  • RQ2다양한 종류와 수준의 텍스트 손상 하에서 워터마크의 무결성을 유지할 수 있도록 신경 보완 모델을 어떻게 훈련시킬 수 있는가?
  • RQ3불변 특징에 워터마크를 고정시키는 방식이 무작위 또는 히وري스틱 기반 삽입 전략 대비 얼마나 더 강건한가?
  • RQ4신경 워터마킹에서 워터마크의 강건성과 의미 품질 사이의 상호 상충 관계는 무엇이며, 아키텍처 및 훈련 선택을 통해 이를 완화할 수 있는가?
  • RQ5실제 손상 상황에서 다양한 텍스트 유형과 글 스타일에 대해 제안된 방법은 어떻게 성능을 보이는가?

주요 결과

  • 제안된 방법은 네 가지 다양한 데이터셋, 세 가지 손상 유형, 두 가지 손상 비율에서 이전 작업 대비 평균 16.8%포인트 향상된 워터마크 추출 정확도를 달성한다.
  • 키워드와 의존 구조와 같은 불변 특징을 삽입 기반으로 사용함으로써 소량의 텍스트 수정에 대한 민감도를 감소시켜 강건성을 크게 향상시킨다.
  • 표준 신경 보완 모델 대비 손상에 강건한 보완 모델이 악성 및 무작위 손상 상황에서 워터마크의 무결성을 더 잘 유지한다.
  • 더 높은 강건성에도 불구하고 NLI 정렬 순서와 신경 보완 모델의 피지컬 훈련 덕분에 자동 평가 지표로 측정된 의미 품질이 경쟁 수준을 유지한다.
  • 저널리즘, 웹 소설, LLM 생성 텍스트 등 다양한 글 스타일에 대해 강력한 일반화 능력을 보여준다.
  • 손상 모델링을 위해 악성 공격 기법을 사용한 덕분에 일반적인 손상 유형—예를 들어 토큰 대체 및 삭제—에 대해 저항성이 높다.
Figure 2: Robustness of $g_{1}$ and the difference between robustness of $g_{1}$ and $g_{2}$ under 5% corruption rate on IMDB.
Figure 2: Robustness of $g_{1}$ and the difference between robustness of $g_{1}$ and $g_{2}$ under 5% corruption rate on IMDB.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.