Skip to main content
QUICK REVIEW

[論文レビュー] PrivColl: Practical Privacy-Preserving Collaborative Machine Learning

Yanjun Zhang, Guangdong Bai|arXiv (Cornell University)|Jul 14, 2020
Privacy-Preserving Technologies in Data参考文献 43被引用数 4
ひとこと要約

PrivCollは、同型加算を用いて暗号的にモデル更新を安全に計算する、軽量でプライバシー保護型の共同機械学習フレームワークである。同型暗号やMPCベースの手法と比較して、ニューラルネットワーク学習において最大216倍の高速化を達成しながら、モデルの正確性を維持し、誠実だが好奇な攻撃者モデル下でも証明可能なプライバシーを保証する。

ABSTRACT

Collaborative learning enables two or more participants, each with their own training dataset, to collaboratively learn a joint model. It is desirable that the collaboration should not cause the disclosure of either the raw datasets of each individual owner or the local model parameters trained on them. This privacy-preservation requirement has been approached through differential privacy mechanisms, homomorphic encryption (HE) and secure multiparty computation (MPC), but existing attempts may either introduce the loss of model accuracy or imply significant computational and/or communicational overhead. In this work, we address this problem with the lightweight additive secret sharing technique. We propose PrivColl, a framework for protecting local data and local models while ensuring the correctness of training processes. PrivColl employs secret sharing technique for securely evaluating addition operations in a multiparty computation environment, and achieves practicability by employing only the homomorphic addition operations. We formally prove that it guarantees privacy preservation even though the majority (n-2 out of n) of participants are corrupted. With experiments on real-world datasets, we further demonstrate that PrivColl retains high efficiency. It achieves a speedup of more than 45X over the state-of-the-art MPC/HE based schemes for training linear/logistic regression, and 216X faster for training neural network.

研究の動機と目的

  • 既存の暗号的手法が高い計算コストや通信コストを伴うため、実用的でない共同学習におけるプライバシー保護のギャップを埋める。
  • 共同学習中に、生の訓練データおよび局所モデルパラメータの漏洩を防ぐ。
  • 線形回帰、ロジスティック回帰、深層ニューラルネットワークを含む多様なモデルの高効率な学習を、強力なプライバシー保証のもとで可能にする。
  • 同型乗算や暗号的環境下での非線形関数の実行といった高コストな演算に依存しないようにすることで実用性を高める。
  • 誠実だが好奇な攻撃者モデル下で、$ n-2 $ 人までの参加者が改ざんされた場合でも、プライバシー保護が形式的に証明可能であることを示す。

提案手法

  • データ所有者と信頼できない集約ノードから成る二層アーキテクチャを採用し、データおよびモデルの局所性を保証する。
  • 加法的秘密分散を用いて、同型加算演算のみを用いてモデル更新を分散・安全に計算する。
  • 勾配降下法を加法的プリミティブに分解することで、高コストな同型乗算や非線形演算を回避するため、共同学習ワークフローを再設計する。
  • 誤差逆伝播において連鎖律を用いて計算を局所ノードと集約者に分散させ、正しさを保つ。
  • 線形/ロジスティック回帰およびシグモイド活性化関数を用いた全結合ニューラルネットワークを含む、勾配ベースの任意のモデルに対して正しさを保証する。
  • 攻撃者が$ n-2 $人まで改ざんされた場合でも、機密データやモデルパラメータを学習する確率が無視できるほど小さい($ eq ext{negligible} $)ことを形式的に証明する。

実験結果

リサーチクエスチョン

  • RQ1同型暗号やMPCの高コストな計算・通信を回避しつつ、強力なプライバシー保証を維持できるプライバシー保護型共同学習フレームワークを設計できるか?
  • RQ2同型加算演算のみを用いて、訓練データおよび局所モデルパラメータのエンドツーエンドのプライバシーを達成できるか?
  • RQ3異なる機械学習モデルおよびネットワーク環境下で、このようなフレームワークの性能は、最先端のMPC/HEベースのソリューションと比べてどうなるか?
  • RQ4微分プライバシーに基づく手法とは異なり、ノイズを導入せずにモデルの正確性を維持できるか?
  • RQ5誠実だが好奇な攻撃者モデル下で、$ n-2 $ 人までの参加者が改ざんされた場合の、このフレームワークの理論的プライバシー保証は何か?

主な発見

  • PrivCollは、線形回帰およびロジスティック回帰モデルの学習において、最先端のMPC/HEベースの手法と比較して45倍以上の高速化を達成した。
  • ニューラルネットワーク学習では、MZ17のMPCベースのアプローチと比較して216倍高速であり、60,000件のサンプルを含むWAN環境で18,367.88秒(約5.1時間)で学習を完了した。
  • LAN環境では、60,000件のサンプルでニューラルネットワークを1,352.87秒(約22.5分)で学習可能であり、MZ17はLAN環境でも81時間以上(294,239.7秒)を要した。
  • 非プライベートな学習と同等のモデル正確性を維持しており、微分プライバシー手法で一般的に見られる正確性の低下を回避した。
  • WAN環境では通信コストが支配的であるが、計算コストは効率的であり、通信コストはデータサイズに対して非線形に増加しない。
  • PrivCollの総合的オーバーヘッドはWAN環境では通信に起因するが、依然として実用的である——特にMPCベースの代替手法がWAN環境では非現実的であることを考えると顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。