Skip to main content
QUICK REVIEW

[논문 리뷰] HARMONIC: Harnessing LLMs for Tabular Data Synthesis and Privacy Protection

Yuxin Wang, Duanyu Feng|arXiv (Cornell University)|2024. 08. 06.
Advanced Data Storage Technologies인용 수 4
한 줄 요약

HARMONIC는 k-최근접 이웃 유사 프롬프팅 전략을 통해 행 간 관계를 모델링함으로써 지침 미세조정을 거친 대규모 언어 모델(Large Language Models, LLMs)을 활용해 고품질의 프라이버시 보장형 합성 표형 데이터를 생성하는 새로운 프레임워크를 제안한다. 이 방법은 하류 LLM 작업에서 실제 데이터와 유사한 성능을 달성하면서도 프라이버시 泄露를 크게 줄였으며, 새로운 평가 지표인 DLT(Data Leakage Test)와 LLE(LLM 효율성)를 통해 검증되었다.

ABSTRACT

Data serves as the fundamental foundation for advancing deep learning, particularly tabular data presented in a structured format, which is highly conducive to modeling. However, even in the era of LLM, obtaining tabular data from sensitive domains remains a challenge due to privacy or copyright concerns. Hence, exploring how to effectively use models like LLMs to generate realistic and privacy-preserving synthetic tabular data is urgent. In this paper, we take a step forward to explore LLMs for tabular data synthesis and privacy protection, by introducing a new framework HARMONIC for tabular data generation and evaluation. In the tabular data generation of our framework, unlike previous small-scale LLM-based methods that rely on continued pre-training, we explore the larger-scale LLMs with fine-tuning to generate tabular data and enhance privacy. Based on idea of the k-nearest neighbors algorithm, an instruction fine-tuning dataset is constructed to inspire LLMs to discover inter-row relationships. Then, with fine-tuning, LLMs are trained to remember the format and connections of the data rather than the data itself, which reduces the risk of privacy leakage. In the evaluation part of our framework, we develop specific privacy risk metrics DLT for LLM synthetic data generation, as well as performance evaluation metrics LLE for downstream LLM tasks. Our experiments find that this tabular data generation framework achieves equivalent performance to existing methods with better privacy, which also demonstrates our evaluation framework for the effectiveness of synthetic data and privacy risks in LLM scenarios.

연구 동기 및 목표

  • 개인 정보가 포함된 도메인에서의 현실적인 표형 데이터 생성 과제를 프라이버시 및 규제 제약으로 인해 해결하기 위해.
  • LLM 기반 데이터 합성에서 발생하는 내재된 프라이버시 위험을 해결하기 위해, 모델이 훈련 데이터를 기억하고 泄露할 수 있음을 고려하여.
  • 실제 데이터 인스턴스를 기억하지 않고도 LLM이 합성 표형 데이터를 생성할 수 있도록 하는 프레임워크를 개발하기 위해.
  • 하류 LLM 작업 성능과 합성 데이터의 프라이버시 위험을 평가하기 위해 특화된 새로운 평가 지표를 도입하기 위해.
  • 적절히 미세조정되고 평가된 LLM 기반 합성 데이터가 효과적이면서도 프라이버시에 안전하다는 것을 입증하기 위해.

제안 방법

  • 표형 데이터의 행 간 관계를 학습할 수 있도록 k-최근접 이웃(kNN)에 영향을 받은 지침 미세조정 데이터셋을 구축하여 LLM이 이를 안내하도록 한다.
  • kNN 기반 지침 데이터셋으로 대규모 LLM을 미세조정하여 원시 데이터 값이 아닌 데이터 구조와 관계를 기억하도록 한다.
  • 미세조정된 LLM을 사용해 자동 회귀적으로 토큰을 예측하면서도 특성 수준 및 행 수준의 의존성을 유지하는 방식으로 합성 표형 데이터를 생성한다.
  • 실제 데이터를 합성 출력에서 재구성할 가능성의 정도를 측정함으로써 프라이버시 위험을 정량화하는 데 목적이 있는 DLT(Data Leakage Test)를 새로운 평가 지표로 제안한다.
  • 하류 LLM 작업(예: 미세조정 및 추론)에서 합성 데이터의 효과성을 평가하기 위한 LLE(LLM 효율성)를 평가 지표로 도입한다.
  • 분류 작업을 위한 네 가지 실제 세계의 표형 데이터셋에 프레임워크를 적용하여, 다양한 베이스라인과의 성능 및 프라이버시를 비교한다.

실험 결과

연구 질문

  • RQ1지침 미세조정을 거친 LLM은 실제 인스턴스를 기억하지 않고도 데이터 구조와 관계를 유지하는 합성 표형 데이터를 생성할 수 있는가?
  • RQ2재구성 공격 상황에서 기존 방법과 비교해 LLM 기반 합성 데이터의 프라이버시 위험은 어떠한가?
  • RQ3LLM 기반 합성 데이터가 실제 데이터와 비교해 하류 LLM 작업에서 어느 정도의 성능을 보일 수 있는가?
  • RQ4제안된 평가 지표인 DLT와 LLE는 LLM 기반 합성 표형 데이터의 프라이버시와 유효성 측정에 효과적으로 기여하는가?
  • RQ5kNN 유사 미세조정 전략은 기존 LLM 기반 방법에 비해 합성 데이터 생성의 일관성과 신뢰성 향상에 기여하는가?

주요 결과

  • HARMONIC가 생성한 합성 데이터는 네 개의 데이터셋을 대상으로 하류 LLM 작업에서 실제 데이터와 유사한 성능을 보이며, 평균 성능 저하가 5% 미만이다.
  • DI 데이터셋에서 HARMONIC는 LLM 효율성(LLE) 측면에서 실제 훈련 세트를 초월하여 강력한 하류 유용성을 나타냈다.
  • 모든 데이터셋에서 세 가지 프라이버시 지표(NRS, DCR, DLT)에서 최고 또는 2위 성과를 기록했으며, DLT 점수는 상당히 낮은 데이터 泄露 위험을 시사했다.
  • GReaT 및 RTF와 비교해 런 당 성능의 표준편차가 낮아 안정성이 뛰어나며 일관되고 신뢰할 수 있는 생성 성능을 보였다.
  • 기존의 합성 데이터 방법인 SMOTE 및 TVAE는 하류 LLM 작업에서 성능이 열등하여 LLM 미세조정에 부적합하다는 점을 시사했다.
  • 공격자가 단일 레코드를 재구성하기 위해 거의 전체 k-이웃 세트(k=5)가 필요하므로, 이 프레임워크의 설계는 재구성 공격에 내재적으로 저항한다. 반면 GReaT와 같은 방법은 부분적인 레코드 재구성에 취약하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.