Skip to main content
QUICK REVIEW

[논문 리뷰] Are Large Pre-Trained Language Models Leaking Your Personal Information?

Jie Huang, Hanyin Shao|arXiv (Cornell University)|2022. 05. 25.
Privacy-Preserving Technologies in Data인용 수 8
한 줄 요약

이 논문은 대규모 사전 훈련된 언어 모델(PLM)이 개인 정보, 특히 이메일 주소를 기억하거나 관련 지을 수 있는지 여부를 조사한다. 이는 데이터 유지(기억)와 소유자와의 연결(연결)을 별개의 개인정보 유출 위험으로 구분하여 분석한다. 연구 결과, PLM은 개인 정보를 기억하지만, 이메일 주소를 소유자와 연결하는 능력이 약하기 때문에 표적 개인정보 유출 위험은 크게 감소한다. 이는 현재의 모델들이 상대적으로 안전하지만, 완전히 위험 없이선 아니라는 것을 시사한다.

ABSTRACT

Are Large Pre-Trained Language Models Leaking Your Personal Information? In this paper, we analyze whether Pre-Trained Language Models (PLMs) are prone to leaking personal information. Specifically, we query PLMs for email addresses with contexts of the email address or prompts containing the owner's name. We find that PLMs do leak personal information due to memorization. However, since the models are weak at association, the risk of specific personal information being extracted by attackers is low. We hope this work could help the community to better understand the privacy risk of PLMs and bring new insights to make PLMs safe.

연구 동기 및 목표

  • 대규모 사전 훈련된 언어 모델(PLM)이 이메일 주소와 같은 개인 정보를 泄露하는지 평가하기.
  • 기억(데이터 유지)과 연결(소유자와의 연결)을 별개의 개인정보 유출 위험으로 구분하기.
  • 소유자 이름을 프롬프트로 사용하여 공격자가 특정 개인 정보를 추출할 수 있는 실제 위험 평가하기.
  • PLM 내 개인정보 유출을 완화하기 위한 실질적인 방어 전략 제공하기.
  • 연구자들이 자신의 모델을 배포하기 전 개인정보 유출 위험을 평가하는 데 도움이 되는 지침 제공하기.

제안 방법

  • 저자는 소유자의 이름이나 맥락적 단서를 포함한 프롬프트를 사용하여 PLM을 쿼리하여, 모델이 특정 이메일 주소를 생성할 수 있는지 테스트한다.
  • 기억은 훈련 데이터의 맥락을 프롬프트로 제공했을 때 모델이 개인 이메일을 생성할 수 있는 능력으로 정의하고 측정한다.
  • 연결은 훈련 데이터에 접근하지 못한 상태에서 소유자의 이름을 프롬프트로 제공했을 때 모델이 개인 이메일을 생성할 수 있는 능력으로 정의하고 측정한다.
  • 공개된 모델인 GPT-3 (text-davinci-2)와 GPT-Neo를 대상으로 실험하며, 개인 정보의 원천으로 Enron Email Dataset를 사용한다.
  • 공격 성공률은 다양한 프롬프트 패턴과 모델 크기에서 모델이 정확한 이메일을 얼마나 자주 생성하는지 측정하여 평가한다.
  • 차별적 프라이버시 훈련, 후처리 필터, 이미지 기반 이메일 표시와 같은 오브스큐레이션 기법을 포함한 방어 전략을 제안한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 언어 모델이 이메일 주소와 같은 개인 정보를 어느 정도 기억하는가?
  • RQ2공격자가 소유자의 이름을 프롬프트로 사용하여 특정 개인 정보를 효과적으로 추출할 수 있는가?
  • RQ3모델이 개인 정보를 소유자와 연결하는 능력이 개인정보 유출 위험에 어떤 영향을 미치는가?
  • RQ4프롬프트 패턴, 모델 크기, 사전 지식 등의 요소가 이러한 공격의 성공률을 높이는가?
  • RQ5PLM에서 개인 정보 유출 위험을 줄이기 위한 실질적인 방어 조치는 무엇인가?

주요 결과

  • 대규모 사전 훈련된 언어 모델은 이메일 주소와 같은 개인 정보를 기억함을 확인하여, 민감한 데이터가 모델 파라미터에 유지될 수 있음을 입증한다.
  • 소유자의 이름만으로 특정 이메일을 추출하는 데 성공률이 낮아, PLM의 연결 능력이 약함을 시사한다.
  • 더 길고 구체적인 프롬프트 패턴은 공격 성공률을 크게 높이며, 맥락이 유출 가능성을 향상시킴을 시사한다.
  • 더 큰 모델일수록 개인 정보 유출 성공률이 높아져 스케일이 기억 위험을 증폭시킴을 나타낸다.
  • 연결 능력이 떨어져 표적 개인정보 유출 위험은 낮지만, 기억 자체만으로도 상당한 개인정보 위협이 존재한다.
  • 차별적 프라이버시 훈련, 후처리 필터, 이메일 오브스큐레이션 등의 방어 전략은 효과적으로 유출 위험을 줄일 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.