Skip to main content
QUICK REVIEW

[논문 리뷰] Watermarking Text Data on Large Language Models for Dataset Copyright

Yixin Liu, Hongsheng Hu|arXiv (Cornell University)|2023. 05. 22.
Internet Traffic Analysis and Secure E-voting인용 수 4
한 줄 요약

TextMarker는 NLP 모델 훈련 중 개인 텍스트 데이터를 보호하기 위해 약간의 데이터에 미세한 트리거를 삽입하는 배경화물 기반의 워터마킹 기법을 제안한다. 타겟 모델에 블랙박스 접근 권한을 활용하여, 소유자는 멤버십 추론을 통해 무단 사용 여부를 검증할 수 있으며, 이로써 모델 성능에 거의 영향을 주지 않으면서도 0.1%의 오염 비율로 효과적인 저작권 보호를 달성한다.

ABSTRACT

Substantial research works have shown that deep models, e.g., pre-trained models, on the large corpus can learn universal language representations, which are beneficial for downstream NLP tasks. However, these powerful models are also vulnerable to various privacy attacks, while much sensitive information exists in the training dataset. The attacker can easily steal sensitive information from public models, e.g., individuals' email addresses and phone numbers. In an attempt to address these issues, particularly the unauthorized use of private data, we introduce a novel watermarking technique via a backdoor-based membership inference approach named TextMarker, which can safeguard diverse forms of private information embedded in the training text data. Specifically, TextMarker only requires data owners to mark a small number of samples for data copyright protection under the black-box access assumption to the target model. Through extensive evaluation, we demonstrate the effectiveness of TextMarker on various real-world datasets, e.g., marking only 0.1% of the training dataset is practically sufficient for effective membership inference with negligible effect on model utility. We also discuss potential countermeasures and show that TextMarker is stealthy enough to bypass them.

연구 동기 및 목표

  • 개인 식별 정보와 같은 비공개 텍스트 데이터를 기반으로 훈련된 NLP 모델에서의 개인정보 泄露 위험 증가에 대응한다.
  • 개인이 자신의 비공개 텍스트가 무단으로 모델 훈련에 사용되었는지 확인할 수 있는 실용적인 방법을 제공한다.
  • 화이트박스 접근이 필요하거나 광범위한 계산 자원이 요구되는 기존 멤버십 추론 방법의 한계를 극복한다.
  • 블랙박스 접근 조건 하에서 작동하며, 모델 트레이너에 의해 탐지되는 것을 저지하는 스텔스성 높은 확장 가능한 워터마킹 기반 메커니즘을 개발한다.

제안 방법

  • 의미적으로 일관되고 맥락적으로 타당한 트리거 패턴을 사용하여 비공개 텍스트 데이터의 소수의 부분(0.1%)에 배경화물 트리거를 삽입한다.
  • 워터마킹된 데이터를 사용해 NLP 모델을 훈련시켜, 트리거가 존재할 경우 모델이 목표 레이블을 출력하도록 한다.
  • 블랙박스 모델에 트리거가 삽입된 샘플을 쿼리하고, 예측 신뢰도를 사전 설정된 임계값과 비교함으로써 멤버십 추론을 수행한다.
  • 감지 가능성을 최소화하기 위해 단어 수준, 문장 수준, 문자 수준의 스텔스성 높은 트리거 패턴을 선택한다.
  • 임bed딩 기반 이상 탐지(예: all-mpnet-base-v2)를 활용해 스텔스성을 평가하며, 텍스트 및 레이블 임베딩 간 유사도를 측정한다.
  • 트리거 배치 위치(시작, 중간, 끝, 또는 무작위)를 최적화하여 배경화물 성공률을 극대화하면서도 탐지 가능성을 최소화한다.

실험 결과

연구 질문

  • RQ1블랙박스 접근 권한만으로도 배경화물 기반 워터마킹 기법을 통해 데이터 소유자가 자신의 비공개 텍스트가 무단으로 NLP 모델 훈련에 사용되었는지 검증할 수 있는가?
  • RQ2TextMarker는 0.1% 미만의 오염 비율에서도 높은 멤버십 추론 정확도를 달성하는가?
  • RQ3최신의 배경화물 방어 기법들에 대해 TextMarker는 어느 정도 탐지 가능성을 회피할 수 있는가?
  • RQ4다양한 트리거 패턴과 위치가 워터마킹의 성공률과 스텔스성에 어떤 영향을 미치는가?
  • RQ5고정된 대신 무작위로 트리거 타겟을 선택할 경우, 멤버십 추론 성능과 변동성에 어떤 영향을 미치는가?

주요 결과

  • TextMarker는 오직 0.1%의 오염 비율로도 효과적인 멤버십 추론을 달성하여, 저작권 검증을 위한 최소한의 데이터 마킹으로도 충분함을 보여준다.
  • 모델 성능에 거의 영향을 주지 않으며, 다양한 실세계 데이터셋에서 후행 분류 성능에 큰 영향을 주지 않는다.
  • 두 가지 최신의 배경화물 탐지 기법을 성공적으로 우회하여, 탐지 정확도가 랜덤 추측 수준(예: QA-Sim-S 기준 약 5.5%)에 근접함을 확인하여 강력한 스텔스성을 입증한다.
  • 무작위 트리거 배치가 고정된 위치(시작, 중간, 끝)보다 성능이 뛰어나며, 이는 더 높은 불확실성과 예측 불가능성 때문일 것이다.
  • 문장 수준의 트리거가 단어 수준이나 문자 수준의 트리거보다 더 높은 배경화물 성공률을 기록하지만, 문자 수준의 트리거는 더 숨기기 쉬운 편이다.
  • 트리거 타겟을 고정함으로써 공격 성공률의 변동성을 감소시켜, 효과성에 손상 없이도 멤버십 추론의 신뢰성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.