Skip to main content
QUICK REVIEW

[논문 리뷰] TOFU: A Task of Fictitious Unlearning for LLMs

Pratyush Maini, Zhili Feng|arXiv (Cornell University)|2024. 01. 11.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)에서의 기억 삭제(unlearning)를 평가하기 위한 TOFU라는 벤치마크를 소개한다. 합성 저자 프로필을 사용하여 특정 데이터를 효과적으로 잊을 수 있는지 테스트한다. 네 가지 기초 기억 삭제 방법을 테스트했음에도 불구하고, 기존 방법들은 효과적인 기억 삭제를 달성하지 못하는 것으로 나타났으며, 이는 개인정보 보호를 위한 LLM 튜닝 기법에 있어 심각한 격차가 있음을 시사한다.

ABSTRACT

Large language models trained on massive corpora of data from the web can memorize and reproduce sensitive or private data raising both legal and ethical concerns. Unlearning, or tuning models to forget information present in their training data, provides us with a way to protect private data after training. Although several methods exist for such unlearning, it is unclear to what extent they result in models equivalent to those where the data to be forgotten was never learned in the first place. To address this challenge, we present TOFU, a Task of Fictitious Unlearning, as a benchmark aimed at helping deepen our understanding of unlearning. We offer a dataset of 200 diverse synthetic author profiles, each consisting of 20 question-answer pairs, and a subset of these profiles called the forget set that serves as the target for unlearning. We compile a suite of metrics that work together to provide a holistic picture of unlearning efficacy. Finally, we provide a set of baseline results from existing unlearning algorithms. Importantly, none of the baselines we consider show effective unlearning motivating continued efforts to develop approaches for unlearning that effectively tune models so that they truly behave as if they were never trained on the forget data at all.

연구 동기 및 목표

  • 특히 생성형 모델을 대상으로 한 기억 삭제에 대한 표준화된 평가의 부재를 해결하기 위해.
  • 기억 삭제된 특정 데이터의 영향을 분리하여 정의된, 재현 가능한 벤치마크를 구축하기 위해.
  • 기억 삭제 품질과 모델 유틸리티 메트릭을 결합한 종합적인 평가 프레임워크를 개발하기 위해.
  • 실제 계산 자원 제약 조건 하에서 기존 기억 삭제 알고리즘의 효과성을 평가하기 위해.
  • 현재 방법들이 의미 있는 기억 삭제를 달성하지 못한다는 것을 보여줌으로써 향후 연구를 촉진하기 위해.

제안 방법

  • LLM의 피너튜닝을 위한 학습 데이터로 사용할 200개의 가공된 저자 프로필을 생성하며, 각 프로필은 20개의 질문-답변 쌍을 포함한다.
  • 기억 삭제의 심각도 수준을 다양하게 테스트하기 위해 2개, 10개, 또는 20개의 프로필을 '기억 삭제 세트(forget set)'로 정의한다.
  • 기억 삭제 세트에서 정답 대비 오답에 대한 확률 비율을 기반으로 한 기억 삭제 품질 메트릭을 설계한다.
  • 기억 삭제된 모델과 골드 표준 유지 모델 간의 답변 확률 분포를 비교하기 위해 코모고로프-스미르노프(Kolmogorov-Smirnov, KS) 검정을 적용한다.
  • 기타 평가 데이터셋을 다양한 관련성 기울기로 활용하여 모델 유틸리티를 집계하여 성능 유지 정도를 측정한다.
  • 실제 적용 가능성에 부합하기 위해 기억 삭제 알고리즘의 계산 복잡도를 기록 샘플 수의 O(수준)로 제약한다.

실험 결과

연구 질문

  • RQ1기존의 기억 삭제 방법들은 특정 실체에 대한 정보를 피너튜닝된 LLM에서 효과적으로 삭제할 수 있는가?
  • RQ2기억 삭제 방법들은 기억 삭제 대상 외 데이터에 대해 모델 유틸리티를 어느 정도 유지하는가?
  • RQ3현재 사용 중인 기억 삭제 메트릭은 약간의 기억 삭제 보장을 어떻게 잘 반영하는가?
  • RQ4TOFU와 같은 통합 벤치마크는 현재 기억 삭제 접근법의 체계적 결함을 드러낼 수 있는가?
  • RQ5전체 모델 성능이 떨어지지 않도록 효과적인 기억 삭제를 달성할 수 있는가?

주요 결과

  • 테스트한 네 가지 기초 기억 삭제 방법 중 어느 것도 기억 삭제 품질 및 모델 유틸리티 메트릭 측면에서 효과적인 기억 삭제를 달성하지 못했다.
  • 많은 모델들이 높은 기억 삭제 품질(낮은 KS-검정 p-값)을 보였지만, 모델 유틸리티가 낮아 난잡한 또는 무작위 출력을 생성하는 경향을 보였다.
  • 결과적으로 현재 기억 삭제 방법들은 (ε,δ)-기억 삭제를 달성하지 못하며, 종이상으로는 기억을 삭제한 것처럼 보일지라도 실제로는 그렇지 않음을 보여준다.
  • 벤치마크는 기억과 삭제 과정 간의 얽힘으로 인해 기억 삭제가 본질적으로 어려운 문제임을 드러낸다.
  • 기존의 정렬 기법들인 RLHF나 DPO는 원치 않는 행동이나 기억된 사실을 완전히 제거하지 못할 수 있으며, 이는 모델 제어 문제의 더 깊은 문제를 암시한다.
  • 본 연구는 현재 기억 삭제 방법들이 개인정보 보호를 위한 약한 尝시적 노력에 불과하며, 향후 개선 여지가 크다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.