Skip to main content
QUICK REVIEW

[論文レビュー] Decision Tree Classification on Outsourced Data

Koray Mancuhan, Chris Clifton|arXiv (Cornell University)|Oct 18, 2016
Privacy-Preserving Technologies in Data参考文献 18被引用数 3
ひとこと要約

本稿では、l-多様性の解体モデルに基づく外部化されたデータに対して、共同意思決定木学習手法(cdtl)を提案する。クラウドサーバーが大部分の学習を実行するが、クライントは軽量な修正を適用することで精度を向上させる。この手法により、非プライベートの意思決定木の精度にほぼ近い結果が得られるとともに、クライント側の計算およびメモリ使用量が大幅に削減される。

ABSTRACT

This paper proposes a client-server decision tree learning method for outsourced private data. The privacy model is anatomization/fragmentation: the server sees data values, but the link between sensitive and identifying information is encrypted with a key known only to clients. Clients have limited processing and storage capability. Both sensitive and identifying information thus are stored on the server. The approach presented also retains most processing at the server, and client-side processing is amortized over predictions made by the clients. Experiments on various datasets show that the method produces decision trees approaching the accuracy of a non-private decision tree, while substantially reducing the client's computing resource requirements.

研究の動機と目的

  • 機密性の高い属性と識別子属性が断片化され暗号化された、外部化されたl-多様性データ上で正確な意思決定木学習を可能にすること。
  • クラウドベースのデータ外部化モデルにおけるクライント側の計算およびストレージオーバーヘッドを最小限に抑えること。
  • クライントとクラウドサーバー間の共同学習が、非プライベートモデルとほぼ同等の精度の意思決定木を生成できるかどうかを評価すること。
  • プライバシー保護環境下でのクライントリソースの節約とモデル精度のトレードオフを評価すること。

提案手法

  • データは識別子テーブル(準識別子)と機密属性テーブルに分割され、結合キーが暗号化されてリンク攻撃を防止する。
  • クラウドデータベースサーバー(CDBS)は、匿名化されl-多様性を満たすデータセットを用いて、基本的意思決定木(BDT)を学習する。
  • クライントはBDTの最大のリーフを出発点として受け取り、ローカルデータを用いて即座に修正し、クライント計算を最小限に抑える。
  • クライント側の修正は、BDTの最大リーフからのサブツリーの再訓練を含み、過学習を回避するためのプルーニングが適用される。
  • 実行時間およびメモリの節約は比で測定される:ets = cdtl_time / cnl_time および ms = cdtl_memory / cnl_memory であり、cnlは非プライベートベースラインを表す。
  • 実験では10分割交差検証を用い、cdtl、cdbsl(クラウド専用)、cnl(非プライベート)モデルの公平な比較のため、同一のプルーニングセットを採用する。

実験結果

リサーチクエスチョン

  • RQ1外部化されl-多様性を満たすデータ上で、共同クライント・サーバーモデルを用いて正確な意思決定木を学習できるか?
  • RQ2高い予測精度を維持しつつ、クライント側の計算およびメモリ使用量をどの程度まで削減できるか?
  • RQ3多様なデータセットにおいて、共同学習モデル(cdtl)の精度が非プライベートモデルおよびクラウド専用モデルと比べてどのように異なるか?
  • RQ4特に過学習の観点から、クライントリソースの節約とモデルの複雑さのトレードオフはどのようなものか?

主な発見

  • cdtlモデルは、非プライベートベースライン(cnl)と一貫して近い予測精度を達成しており、データセット全体で平均して2〜5%の差に収束する。
  • 実行時間の節約(ets)およびメモリ節約(ms)は、CDBS上で学習された基本的意思決定木(BDT)が複雑である場合に最大となり、クライント側の効率性が高まることを示している。
  • クラウドの基本ツリーのみを用いるcdbslモデルは、最も低い精度を示し、クライント側の修正がパフォーマンス向上に不可欠であることを確認している。
  • BDTのリーフサイズが小さすぎる(高メモリ節約)場合、特にAdultデータセットで過学習が発生し、モデルの複雑さに起因して精度が低下する。
  • 本手法により、クライント側の学習および推論コストが顕著に削減され、有利な状況ではメモリおよび時間の節約比(etsおよびms)が0に近づく。
  • 過学習の緩和のため、BDTリーフサイズに対するメモリ節約のしきい値を提案するが、最適値はデータセットに依存し、普遍的に定義するのは困難である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。