[論文レビュー] CuTS: Customizable Tabular Synthetic Data Generation
CuTS は、宣言的言語を用いて多様な統計的・論理的・公平性制約を定義できるカスタマイズ可能な表形式の合成データ生成フレームワークである。生成モデルを事前学習し、ユーザーが指定した制約の微分可能緩和を用いてファインチューニングすることで、公平性制約下で Adult データセットにおいて最新の手法よりも 2.3% 高い下流の精度を達成し、高品質な合成データを実現している。
Privacy, data quality, and data sharing concerns pose a key limitation for tabular data applications. While generating synthetic data resembling the original distribution addresses some of these issues, most applications would benefit from additional customization on the generated data. However, existing synthetic data approaches are limited to particular constraints, e.g., differential privacy (DP) or fairness. In this work, we introduce CuTS, the first customizable synthetic tabular data generation framework. Customization in CuTS is achieved via declarative statistical and logical expressions, supporting a wide range of requirements (e.g., DP or fairness, among others). To ensure high synthetic data quality in the presence of custom specifications, CuTS is pre-trained on the original dataset and fine-tuned on a differentiable loss automatically derived from the provided specifications using novel relaxations. We evaluate CuTS over four datasets and on numerous custom specifications, outperforming state-of-the-art specialized approaches on several tasks while being more general. In particular, at the same fairness level, we achieve 2.3% higher downstream accuracy than the state-of-the-art in fair synthetic data generation on the Adult dataset.
研究の動機と目的
- 微分プライバシー や公平性といった狭い制約しかサポートしない既存の合成データ手法の限界に対処すること。
- データ所有者が広範な統計的・論理的・公平性仕様をカスタマイズ可能な合成データ生成を可能にすること。
- 統一された学習フレームワークを用いて、多様なユーザー定義制約を強制しながらも高いデータユーティリティを維持すること。
- 複雑なデータ生成要件を指定するための汎用的で使いやすいインターフェースを提供すること。
提案手法
- CuTS は、元の表形式データセット上で事前学習された生成モデルを用い、その背後にあるデータ分布を学習する。
- ユーザーが指定した制約(統計的・論理的・公平性関連)は、新規の緩和手法を用いて微分可能な損失関数に変換される。
- 事前学習の目的関数と緩和された制約損失関数を組み合わせた微分可能な損失関数を用いて、モデルをエンドツーエンドでファインチューニングする。
- 微分プライバシーの実装には、勾配感度に基づく適応的ノイズスケーリングを用いた、修正されたプライバシー予算冷却戦略を採用している。
- 下流の分類器における望ましい挙動(例:低バイアス)を促進するために、ソフト制約をサポートしている。
- 統計表記を用いたドメイン固有の言語により、コードベースの代替手法よりも使いやすい制約の指定が可能になっている。

実験結果
リサーチクエスチョン
- RQ11 つのフレームワークが、微分プライバシーや公平性を越えて、広範なカスタマイズ可能な制約を表形式の合成データ生成にサポートできるか?
- RQ2複雑で多様な制約を強制する際、CuTS がどのように高いデータ品質を維持できるか?
- RQ3公平性やプライバシーといった共有制約下で、CuTS が特殊化された最先端の手法をどの程度上回れるか?
- RQ4医療データにおける薬物試験の焦点といった、機微な統計的パターンを隠蔽しながら、データユーティリティをどの程度保持できるか?
主な発見
- Adult データセットにおいて、同じ公平性レベル下で、最新の手法よりも 2.3% 高い下流の精度を達成した。
- デモグラフィックパリティ距離を 0.01 まで低減し、先行研究比で 2 倍の改善を達成した。
- Health Heritage データセットで患者の状態分布を隠蔽した際、特徴量のエントロピーを向上させつつ、下流の精度を約 1% 割り損ねたにとどまった。
- 微分プライバシー、公平性、論理的含意といった多様な制約を同時にスタックしても、顕著なユーティリティの低下が生じず、効果的に処理できた。
- SDV や AIM におけるコードベースの制約宣言と比較して、宣言的で統計表記に基づいたインターフェースにより、優れた使いやすさを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。