Skip to main content
QUICK REVIEW

[논문 리뷰] Memorization in NLP Fine-tuning Methods

Fatemehsadat Mireshghallah, Archit Uniyal|arXiv (Cornell University)|2022. 05. 25.
Topic Modeling인용 수 11
한 줄 요약

이 논문은 NLP 피니튜닝 방법에서의 기억화 위험을 조사하며, 멤버십 인식 공격과 데이터 추출 공격을 사용하여 세 가지 접근 방식—전체 피니튜닝, 헤드 전용 피니튜닝, 어댑터 피니튜닝—을 평가한다. 연구 결과, 모델 헤드만을 피니튜닝하는 방식이 전체 피니튜닝이나 어댑터 피니튜닝에 비해 상당히 높은 기억화 수준을 보이며, 이는 개인정보 보호와 성능 간의 트레이드오프에서 훨씬 더 우수한 페레토 최적 경계를 형성한다.

ABSTRACT

Large language models are shown to present privacy risks through memorization of training data, and several recent works have studied such risks for the pre-training phase. Little attention, however, has been given to the fine-tuning phase and it is not well understood how different fine-tuning methods (such as fine-tuning the full model, the model head, and adapter) compare in terms of memorization risk. This presents increasing concern as the "pre-train and fine-tune" paradigm proliferates. In this paper, we empirically study memorization of fine-tuning methods using membership inference and extraction attacks, and show that their susceptibility to attacks is very different. We observe that fine-tuning the head of the model has the highest susceptibility to attacks, whereas fine-tuning smaller adapters appears to be less vulnerable to known extraction attacks.

연구 동기 및 목표

  • 대규모 언어 모델에서 다양한 피니튜닝 방법이 훈련 데이터의 기억화에 미치는 영향을 이해하기 위해.
  • 피니튜닝 데이터가 일반적으로 소규모이며 정밀하게 목표가 되기 때문에, 피니튜닝과 관련된 개인정보 유출 위험을 평가하기 위해.
  • 전체 모델, 헤드 전용, 어댑터 피니튜닝과 같은 다양한 피니튜닝 방법이 멤버십 인식 공격 및 데이터 추출 공격에 얼마나 취약한지 비교하기 위해.
  • 실증적 증거를 제공하여 실무자들이 다양한 피니튜닝 전략의 개인정보 보호-성능 트레이드오프를 이해하도록 돕기 위해.

제안 방법

  • 멤버십 인식 공격(MIA) 재현율과 데이터 추출 위험의 Proxy로 사용되는 '노출(Exposure)'을 사용하여 기억화를 실증적으로 평가한다.
  • GPT-2를 사용하여 자동회귀 언어 모델링을 수행하며, 위키피디아, 펜 트리뱅크, 엔론 이메일 세 가지 데이터셋에서 실험을 수행한다.
  • 세 가지 피니튜닝 방법을 비교한다: 전체 모델 피니튜닝, 헤드 전용 피니튜닝, 감소 요인 16과 2를 가진 어댑터 피니튜닝.
  • GPT-2 아키텍처의 다양한 블록(예: 블록 1–6, 7–12, 번갈아가며 블록 선택)을 피니튜닝하여 파라미터 위치의 영향을 분석한다.
  • 파라미터 유대성에 대한 분석을 위해, 연결된(embeddings) 및 연결되지 않은(embeddings) 파라미터를 비교하여 기억화 및 일반화에 미치는 영향을 평가한다.
  • 모델 유틸리티의 Proxy로 검증 퍼플렉서티를 사용하고, 개인정보 보호-성능 트레이드오프를 그림으로 그려 페레토 최적 방법을 식별한다.

실험 결과

연구 질문

  • RQ1피니튜닝 방법의 선택이 모델의 멤버십 인식 공격에 대한 취약성에 어떤 영향을 미치는가?
  • RQ2전체 모델, 헤드 전용, 또는 어댑터만을 피니튜닝할 경우 상대적인 기억화 위험은 어떻게 되는가?
  • RQ3가장 훈련 가능한 파라미터의 아키텍처적 위치(예: 초기 레이어 대비 후기 레이어)가 기억화에 영향을 미치는가?
  • RQ4입력 임베딩과 언어 모델 헤드 간의 파라미터 유대성이 개인정보 보호-성능 트레이드오프에 어떤 영향을 미치는가?
  • RQ5일반적으로 사용되는 방법보다 더 나은 개인정보 보호-성능 트레이드오프를 달성할 수 있는 피니튜닝 설정이 존재하는가?

주요 결과

  • 헤드 전용 피니튜닝은 멤버십 인식 공격 재현율 측정 기준으로 가장 높은 기억화를 보이며, 이는 전체 피니튜닝을 초월한다.
  • 전체 모델 피니튜닝과 어댑터 피니튜닝은 공격 재현율 대 검증 퍼플렉서티의 관계에서 페레토 최적 경계에 위치해 있어, 더 나은 개인정보 보호-성능 트레이드오프를 나타낸다.
  • 감소 요인 16과 2를 가진 어댑터 피니튜닝은 헤드 전용 피니튜닝에 비해 알려진 데이터 추출 공격에 덜 취약하다.
  • GPT-2의 마지막 여섯 블록(7–12)을 피니튜닝하는 것은 첫 번째 여섯 블록(1–6)을 피니튜닝하는 것보다 더 높은 기억화를 유도하며, 이는 후기 레이어가 기억화에 더 취약하다는 것을 시사한다.
  • 8번 블록을 개별적으로 피니튜닝할 경우, 가장 낮은 공격 재현율과 가장 낮은 퍼플렉서티를 기록하여 개인정보 보호-성능 균형 측면에서 가장 유리한 단일 블록 피니튜닝 설정이 된다.
  • 입력 임베딩과 헤드 파라미터를 유대하지 않으면 개인정보 보호-성능 트레이드오프가 악화되며, 이는 파라미터 유대가 일반화를 향상시키고 기억화를 줄이는 데 기여함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.