Skip to main content
QUICK REVIEW

[논문 리뷰] A Semantic Invariant Robust Watermark for Large Language Models

Aiwei Liu, Leyi Pan|arXiv (Cornell University)|2023. 10. 10.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델을 위한 의미적 불변 워터마킹 기법을 제안한다. 이 기법은 전행 토큰의 의미적 임bedding을 기반으로 워터마킹 로짓을 생성하기 위해 전용 워터마킹 모델을 사용한다. BERT 기반 인코더와 유사도 및 정규화 손실을 최적화한 학습된 변환 네트워크를 활용함으로써, 복구 및 동의어 치환과 같은 공격에 대해 높은 공격 내성과 동시에 강력한 보안 내성을 확보하여 오랫동안 지속된 내성 유형 간의 상충 관계를 해결한다.

ABSTRACT

Watermark algorithms for large language models (LLMs) have achieved extremely high accuracy in detecting text generated by LLMs. Such algorithms typically involve adding extra watermark logits to the LLM's logits at each generation step. However, prior algorithms face a trade-off between attack robustness and security robustness. This is because the watermark logits for a token are determined by a certain number of preceding tokens; a small number leads to low security robustness, while a large number results in insufficient attack robustness. In this work, we propose a semantic invariant watermarking method for LLMs that provides both attack robustness and security robustness. The watermark logits in our work are determined by the semantics of all preceding tokens. Specifically, we utilize another embedding LLM to generate semantic embeddings for all preceding tokens, and then these semantic embeddings are transformed into the watermark logits through our trained watermark model. Subsequent analyses and experiments demonstrated the attack robustness of our method in semantically invariant settings: synonym substitution and text paraphrasing settings. Finally, we also show that our watermark possesses adequate security robustness. Our code and data are available at \href{https://github.com/THU-BPM/Robust_Watermark}{https://github.com/THU-BPM/Robust\_Watermark}. Additionally, our algorithm could also be accessed through MarkLLM \citep{pan2024markllm} \footnote{https://github.com/THU-BPM/MarkLLM}.

연구 동기 및 목표

  • LLM 워터마킹에서 공격 내성과 보안 내성 간의 본질적 상충 관계를 해결하기 위해.
  • 의미적으로 불변인 텍스트 수정(예: 다듬어쓰기, 동의어 치환) 조건에서도 효과적인 워터마킹 방법을 개발하기 위해.
  • 워터마킹 로짓이 다양하고 편향이 없으며 빈도 기반 해킹 공격에 저항할 수 있도록 보장하기 위해.
  • 워터마킹 로짓과 LLM 로짓을 동시에 병렬 계산할 수 있도록 하여 텍스트 생성 시 지연 영향을 최소화하기 위해.
  • 텍스트 품질을 유지하면서도 높은 탐지 정확도를 확보하기 위해, 퍼플렉서피 측정 기준으로 평가한다.

제안 방법

  • 이 방법은 이전 토큰들로부터 의미적 임베딩을 추출하기 위해 별도의 임베딩 LLM(예: Compositional-BERT)을 사용한다.
  • 학습 가능한 워터마킹 모델은 네 층으로 구성된 피드포워드 네트워크를 통해 이러한 의미적 임베딩을 워터마킹 로짓으로 변환한다.
  • 워터마킹 모델은 두 가지 목적을 위해 학습된다: 워터마킹 로짓에서 의미적 유사도를 유지하는 유사도 손실, 그리고 균형 잡히고 양방향으로 분포된 로짓(0을 중심으로)을 보장하는 정규화 손실.
  • 워터마킹 로짓은 탄젠트 하이퍼볼릭 함수를 사용해 스케일링되어 ±1에 가까운 값을 생성함으로써 편향을 최소화하고 다양성을 극대화한다.
  • 생성 과정에서 워터마킹 로짓과 LLM 로짓이 병렬로 처리되어 최소한의 지연 시간 오버헤드를 유발한다.
  • 워터마킹 탐지는 모든 토큰의 워터마킹 로짓을 평균 내어 수행되며, 평균 값이 상당히 양수일 경우 워터마킹 존재를 나타낸다.
Figure 1: An illustration of our semantic invariant robust watermarking method. Text is input into a generative LLM for token logits and an embedding LLM for text embedding. The embedding is converted into watermark logits via the Watermark Model. LLM logits and watermark logits are then combined fo
Figure 1: An illustration of our semantic invariant robust watermarking method. Text is input into a generative LLM for token logits and an embedding LLM for text embedding. The embedding is converted into watermark logits via the Watermark Model. LLM logits and watermark logits are then combined fo

실험 결과

연구 질문

  • RQ1의미적으로 불변인 텍스트 변형(예: 동의어 교체, 다듬어쓰기) 조건에서도 워터마킹 기법이 내성을 유지할 수 있는가?
  • RQ2기존의 상충 관계를 극복하고, 동시에 높은 공격 내성과 강력한 보안 내성을 동시에 확보할 수 있는 워터마킹 기법이 가능한가?
  • RQ3어떻게 하면 의미 변화에 불변이지만 텍스트의 구조적 패턴에 민감한 방식으로 워터마킹 로짓을 생성할 수 있는가?
  • RQ4워터마킹 기법이 퍼플렉서피 측정 기준으로 텍스트 품질에 어느 정도 영향을 미치는가?
  • RQ5워터마킹 프로세스는 효율적으로 병렬 처리되어 추론 지연 시간을 최소화할 수 있는가?

주요 결과

  • 제안된 방법은 동의어 치환 및 다듬어쓰기 조건에서 KGW-1(전역 워터마킹 로짓)과 유사한 공격 내성을 확보하며, 워터마킹 로짓 기반 방법의 이론적 상한선에 근접한다.
  • 가짜 공격(스포핑 어택) 상황에서 이 방법은 강력한 보안 내성을 보이며, 워터마킹을 추출하려는 악성 사용자에 대해 낮은 복호화 정확도를 기록하여 이전 방법들을 능가한다.
  • 워터마킹 모델은 입력 임베딩 유사도와 출력 워터마킹 로짓 유사도 사이에 강한 상관관계를 유지하며, 특히 높은 의미 유사도를 가진 입력(유사도 > 0.8)에 대해 뚜렷한 성능을 보인다.
  • 텍스트 품질에 미치는 영향은 미미하며, 퍼플렉서피가 약간 증가할 뿐이며, KGW-시리즈 방법들보다 약간 낮아 더 우수한 유창성과 일관성을 나타낸다.
  • 지연 시간 증가는 미미하며, LLaMA-7B에서 병렬 처리를 하지 않을 경우 40%의 시간 오버헤드만 발생하며, 워터마킹 로짓과 LLM 로짓을 동시에 계산할 경우 생성 속도는 거의 동일하다.
  • 정규화 손실은 극단적인 로짓 값을 방지하고 대칭적이며 편향 없는 토큰 선택을 보장하여 보안성과 다양성을 향상시킨다.
A Semantic Invariant Robust Watermark for Large Language Models

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.