Skip to main content
QUICK REVIEW

[論文レビュー] Machine Unlearning for Random Forests

Jonathan Brophy, Daniel Lowd|arXiv (Cornell University)|Sep 11, 2020
Machine Learning and Data Classification被引用数 6
ひとこと要約

この論文では、再訓練を最小限に抑えて正確かつ効率的に学習インスタンスを削除できるランダムフォレストの変種、DaREフォレストを紹介する。ランダムノードと貪欲ノードにおけるキャッシュ済み統計を組み合わせることで、DaREフォレストは、再訓練から比べて最大10,000倍速くデータ削除を実現しながら、元のモデルと1%以内の予測性能を維持する。

ABSTRACT

Responding to user data deletion requests, removing noisy examples, or deleting corrupted training data are just a few reasons for wanting to delete instances from a machine learning (ML) model. However, efficiently removing this data from an ML model is generally difficult. In this paper, we introduce data removal-enabled (DaRE) forests, a variant of random forests that enables the removal of training data with minimal retraining. Model updates for each DaRE tree in the forest are exact, meaning that removing instances from a DaRE model yields exactly the same model as retraining from scratch on updated data. DaRE trees use randomness and caching to make data deletion efficient. The upper levels of DaRE trees use random nodes, which choose split attributes and thresholds uniformly at random. These nodes rarely require updates because they only minimally depend on the data. At the lower levels, splits are chosen to greedily optimize a split criterion such as Gini index or mutual information. DaRE trees cache statistics at each node and training data at each leaf, so that only the necessary subtrees are updated as data is removed. For numerical attributes, greedy nodes optimize over a random subset of thresholds, so that they can maintain statistics while approximating the optimal threshold. By adjusting the number of thresholds considered for greedy nodes, and the number of random nodes, DaRE trees can trade off between more accurate predictions and more efficient updates. In experiments on 13 real-world datasets and one synthetic dataset, we find DaRE forests delete data orders of magnitude faster than retraining from scratch while sacrificing little to no predictive power.

研究の動機と目的

  • プライバシー規制(例:忘れられる権利)に伴い、機械学習モデルにおける効率的なデータ削除のニーズが高まっていることを踏まえ、その対応を目的とする。
  • 完全な再訓練なしに、木ベースのモデル、特にランダムフォレストにおける学習インスタンスの正確なアンラーニングを可能にすること。
  • 予測精度を維持しながら、高速かつ正確なデータ削除を可能にするモデルアーキテクチャの設計を目的とする。
  • 多様な実世界のデータセットを対象に、削除効率とモデル性能のトレードオフを評価すること。

提案手法

  • DaREフォレストはハイブリッド木構造を採用:上位レベルのノードはランダムに選択され(属性およびしきい値が一様にランダムに選ばれる)、学習データへの依存度を低減する。
  • 下位レベルのノードは貪欲で、ジニ係数やエントロピーなどのスプリット基準を最適化するが、統計を効率的に維持するために、しきい値のランダムサブセットを用いる。
  • 各ノードは統計要約(例:クラスカウント、しきい値統計)をキャッシュしており、削除時、必要なサブツリーのみを更新可能である。
  • データ削除は、影響を受けるサブツリーのみを再帰的に更新することで実行され、その結果得られるモデルは、再訓練から得られるものと数学的に同等である。
  • ランダムノードの数と、貪欲ノードで考慮するしきい値の数は、チューニング可能なハイパーパrameterであり、精度と更新速度のトレードオフを可能にする。
  • 本手法は、正確なアンラーニング(再訓練と同等)と、悪意のある削除パターンに対しても効率的な削除シーケンスの両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1完全な再訓練なしに、正確かつ効率的な学習インスタンスの削除を可能にするランダムフォレストの変種を設計できるか?
  • RQ2木の上部にランダムノードを配置することで、削除効率とモデル精度にどのような影響を与えるか?
  • RQ3貪欲ノードで考慮するしきい値の数を変化させた場合、削除速度と予測性能にどのような影響があるか?
  • RQ4特に速度と精度保持の観点から、悪意のある削除シーケンス下でもモデルの性能はどのように変化するか?
  • RQ5提案手法は、大規模な実世界データセットに対しても、高い削除効率と低い性能低下を維持しながらスケーラブルか?

主な発見

  • 実世界のデータセットにおいて、DaREフォレストは、単純な再訓練と比較して、最大10,000倍速いデータ削除速度を達成し、中央値での高速化は1,000倍以上であった。
  • 13の実世界データセットと1つの合成データセットすべてにおいて、削除後もDaREフォレストは元のモデルと1%以内の予測性能を維持した。
  • 木の上部にランダムノードを配置することで、再訓練処理の回数が最大90%まで削減され、削除効率が顕著に向上した。
  • 悪意のある削除パターンに対しても、本手法は頑健であり、最悪ケースでも再訓練と比較して100倍以上の高速化が達成された。
  • 貪欲ノードにおけるしきい値の数とランダムノードの深さをチューニングすることで、精度と削除速度の有効なトレードオフが可能であり、性能低下は最小限に抑えられた。
  • 長時間の学習を要するHiggsデータセットでは、DaREフォレストにより削除時間を5,000秒以上から10秒未満に短縮し、精度の低下は無視できるレベルに留まった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。