Skip to main content
QUICK REVIEW

[論文レビュー] Federated Learning of User Authentication Models

Hossein Hosseini, Sungrack Yun|arXiv (Cornell University)|Jul 9, 2020
Internet Traffic Analysis and Secure E-voting参考文献 26被引用数 5
ひとこと要約

本論文では、生データや埋め込み表現を共有せずに、ユーザー認証モデルを訓練するプライバシー保護型フェデレーテッドラーニングフレームワークであるFedUAを提案する。ランダムなバイナリ埋め込みとユーザー固有のしきい値を設定するウォームアップフェーズを用いることで、コンパクトな埋め込みサイズ(例:512ビット)であっても、未学習ユーザーに対して80%の真正陽性率(TPR)を達成し、偽陽性率(FPR)を0.16%まで低減する。また、フェデレーテッド環境下でスケーラブルかつ調整不要な訓練を実現する。

ABSTRACT

Machine learning-based User Authentication (UA) models have been widely deployed in smart devices. UA models are trained to map input data of different users to highly separable embedding vectors, which are then used to accept or reject new inputs at test time. Training UA models requires having direct access to the raw inputs and embedding vectors of users, both of which are privacy-sensitive information. In this paper, we propose Federated User Authentication (FedUA), a framework for privacy-preserving training of UA models. FedUA adopts federated learning framework to enable a group of users to jointly train a model without sharing the raw inputs. It also allows users to generate their embeddings as random binary vectors, so that, unlike the existing approach of constructing the spread out embeddings by the server, the embedding vectors are kept private as well. We show our method is privacy-preserving, scalable with number of users, and allows new users to be added to training without changing the output layer. Our experimental results on the VoxCeleb dataset for speaker verification shows our method reliably rejects data of unseen users at very high true positive rates.

研究の動機と目的

  • 中央集権的なユーザー認証(UA)モデルのトレーニングにおけるプライバシーリスクに対処すること。ここでの生データや埋め込み表現は機微な情報である。
  • ユーザーのデータや埋め込み表現を共有せずに、フェデレーテッド環境でUAモデルをトレーニング可能にし、エンド・ツー・エンドのプライバシーを確保すること。
  • 再トレーニングや出力層の変更なしに、新規ユーザーがトレーニングに参加できること。
  • プライバシー保護設計のもとでも、未学習ユーザーに対して高い認証性能(高いTPR、低いFPR)を維持すること。
  • 標準的なフェデレーテッドラーニング通信を超える調整のオーバーヘッドを排除すること。

提案手法

  • ユーザーは自らの生データを用いてローカルでモデルをトレーニングし、サーバーが埋め込みベクトル長を決定することで、高い確率で最小ペアワイズ距離を保証する。
  • 各ユーザーは事前に定めた長さの固定されたランダムバイナリ埋め込みベクトルを生成し、これを秘密に保ち、サーバーや他のユーザーと共有しない。
  • モデルは、出力とユーザーのプライベートなランダムバイナリ埋め込みベクトルとの相関を最大化するようにトレーニングされる。
  • ウォームアップフェーズでは、各ユーザーごとにテスト入力を収集し、所定の真正陽性率(TPR)を満たすためにユーザー固有の受容しきい値を計算する。
  • フェデレーテッド平均化(FedAvg)を用い、ローカルトレーニング(E=1エポック)、SGD最適化手法、最小限の通信オーバーヘッドを実現する。
  • 埋め込み長(ne)は、パフォーマンスとモデル効率のバランスをとるために調整され、ne=128、256、512がテストされた。

実験結果

リサーチクエスチョン

  • RQ1生データや埋め込みベクトルを露呈せずに、フェデレーテッド環境でユーザー認証モデルをトレーニングできるか?
  • RQ2ランダムバイナリ埋め込みは、プライバシーを保持しつつも、ユーザー間の十分な分離性を確保できるか?
  • RQ3再トレーニングや出力層の変更なしに、新規ユーザーがトレーニングに参加できるか?
  • RQ4提案手法は、未学習ユーザーに対して高い認証性能(例:高いTPR、低いFPR)を達成できるか?
  • RQ5標準的なフェデレーテッドラーニング通信を超える最小限の調整で、フレームワークを展開できるか?

主な発見

  • 128ビットの埋め込みを用いた場合、80%の真正陽性率(TPR)を達成し、未学習ユーザーの偽陽性率(FPR)は0.27%であった。
  • 256ビットの埋め込みを用いた場合、80%のTPRで未学習ユーザーのFPRは0.18%に低下した。
  • 512ビットの埋め込みを用いた場合、80%のTPRで未学習ユーザーのFPRはさらに0.16%に低下し、より長い埋め込みで性能が向上することが示された。
  • 訓練済みユーザーの検証データでは高い性能を維持したが、未学習ユーザーではわずかに性能が低下したが、依然としてスパイアの拒否において高い信頼性を示した。
  • フレームワークは、出力層の変更やモデルの再トレーニングなしに、動的なユーザー追加をサポートする。
  • ランダムバイナリ埋め込みの使用により、ワンホットエンコーディングと比較して出力サイズが顕著に削減され、スケーラブルな展開が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。