[논문 리뷰] CuTS: Customizable Tabular Synthetic Data Generation
CuTS는 사용자가 선언적 언어를 통해 다양한 통계적, 논리적, 공정성 제약 조건을 정의할 수 있도록 허용하는 사용자 정의 가능한 표형 합성 데이터 생성 프레임워크이다. CuTS는 사전 훈련된 생성 모델을 사용하고 사용자가 지정한 제약 조건의 미분 가능한 리라플리케이션을 활용해 피지컬 훈련을 수행함으로써 높은 품질의 합성 데이터를 생성하며, 공정성 제약 조건 하에서 Adult 데이터셋에서 최신 기술 대비 2.3% 높은 최종 정확도를 달성한다.
Privacy, data quality, and data sharing concerns pose a key limitation for tabular data applications. While generating synthetic data resembling the original distribution addresses some of these issues, most applications would benefit from additional customization on the generated data. However, existing synthetic data approaches are limited to particular constraints, e.g., differential privacy (DP) or fairness. In this work, we introduce CuTS, the first customizable synthetic tabular data generation framework. Customization in CuTS is achieved via declarative statistical and logical expressions, supporting a wide range of requirements (e.g., DP or fairness, among others). To ensure high synthetic data quality in the presence of custom specifications, CuTS is pre-trained on the original dataset and fine-tuned on a differentiable loss automatically derived from the provided specifications using novel relaxations. We evaluate CuTS over four datasets and on numerous custom specifications, outperforming state-of-the-art specialized approaches on several tasks while being more general. In particular, at the same fairness level, we achieve 2.3% higher downstream accuracy than the state-of-the-art in fair synthetic data generation on the Adult dataset.
연구 동기 및 목표
- 기존의 합성 데이터 방법이 차별적 프라이버시나 공정성과 같은 좁은 범위의 제약 조건만 지원하는 한계를 해결하기 위해.
- 데이터 소유자가 다양한 통계적, 논리적, 공정성 사양을 사용자 정의할 수 있도록 합성 데이터 생성을 가능하게 하기 위해.
- 통합된 훈련 프레임워크를 통해 다양한 사용자 정의 제약 조건을 강제하면서도 높은 데이터 유틸리티를 유지하기 위해.
- 복잡한 데이터 생성 요구 사항을 지정하기 위한 일반적이고 접근하기 쉬운 인터페이스를 제공하기 위해.
제안 방법
- CuTS는 원본 표형 데이터셋에 대해 사전 훈련된 생성 모델을 사용하여 기저 데이터 분포를 학습한다.
- 사용자가 지정한 제약 조건—통계적, 논리적, 또는 공정성 관련—은 새로운 리라플리케이션을 통해 미분 가능한 손실 함수로 변환된다.
- 사전 훈련 목표와 리라플리케이션된 제약 조건 손실을 조합한 미분 가능한 손실을 사용해 모델을 종단 간(end-to-end)으로 피지컬 훈련한다.
- 차별적 프라이버시를 위해 CuTS는 기울기 민감도에 기반한 적응적 노이즈 스케일링을 적용한 수정된 프라이버시 예산 안내 전략을 사용한다.
- 프레임워크는 최종 분류기에서 바람직한 행동(예: 낮은 편향)을 장려하기 위해 소프트 제약 조건을 지원한다.
- 도메인 특화 언어를 통해 통계 기호를 사용해 제약 조건을 직관적으로 지정할 수 있으며, 이는 코드 기반 대비 사용성 향상을 이룬다.

실험 결과
연구 질문
- RQ1단일 프레임워크가 차별적 프라이버시나 공정성 이외의 광범위한 사용자 정의 가능한 제약 조건을 표형 합성 데이터 생성에 지원할 수 있는가?
- RQ2복잡하고 다양한 제약 조건을 강제할 때 CuTS는 어떻게 높은 데이터 품질을 유지하는가?
- RQ3공정성 또는 프라이버시와 같은 공통 제약 조건 하에서 CuTS는 전문적인 최신 기술 대비 어느 정도 뛰어난 성능을 보이는가?
- RQ4CuTS는 약물 시험 집중 패턴과 같은 민감한 통계적 패턴을 은폐하면서도 데이터 유틸리티를 얼마나 효과적으로 유지하는가?
주요 결과
- Adult 데이터셋에서 CuTS는 동일한 공정성 수준에서 최신 기술 대비 2.3% 높은 최종 정확도를 달성한다.
- CuTS는 민감도 평등성 거리(distance)를 0.01로 줄여 이전 연구 대비 2배 향상된 성과를 보였다.
- Health Heritage 데이터셋에서 환자 상태 분포를 은폐할 경우, CuTS는 특성 엔트로피를 증가시키면서도 최종 정확도 손실을 약 ≈1% 이내로 유지한다.
- CuTS는 차별적 프라이버시, 공정성, 논리적 함의와 같은 다양한 제약 조건을 동시에 스택하여도 유틸리티가 크게 떨어지지 않는 것을 성공적으로 구현했다.
- SDV와 AIM의 코드 기반 제약 조건 선언 대비, 통계 기호 기반의 선언적 인터페이스를 통해 뛰어난 사용성 향상을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.