Skip to main content
QUICK REVIEW

[論文レビュー] A decentralized aggregation mechanism for training deep learning models using smart contract system for bank loan prediction

Pratik Ratadiya, Khushi Asawa|arXiv (Cornell University)|Nov 22, 2020
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

この論文では、Ethereumスマートコントラクトを介して中間特徴表現を統合することで、バンクローン予測を目的として、垂直に分割されたデータ上でディープラーニングモデルをトレーニングするブロックチェーンベースの分散型アグリゲーションメカニズムを提案する。この手法は、中央集権的トレーニングと同等のパフォーマンスを達成すると同時に、データの機微性を保ちつつ収束を高速化する。

ABSTRACT

Data privacy and sharing has always been a critical issue when trying to build complex deep learning-based systems to model data. Facilitation of a decentralized approach that could take benefit from data across multiple nodes while not needing to merge their data contents physically has been an area of active research. In this paper, we present a solution to benefit from a distributed data setup in the case of training deep learning architectures by making use of a smart contract system. Specifically, we propose a mechanism that aggregates together the intermediate representations obtained from local ANN models over a blockchain. Training of local models takes place on their respective data. The intermediate representations derived from them, when combined and trained together on the host node, helps to get a more accurate system. While federated learning primarily deals with the same features of data where the number of samples being distributed on multiple nodes, here we are dealing with the same number of samples but with their features being distributed on multiple nodes. We consider the task of bank loan prediction wherein the personal details of an individual and their bank-specific details may not be available at the same place. Our aggregation mechanism helps to train a model on such existing distributed data without having to share and concatenate together the actual data values. The obtained performance, which is better than that of individual nodes, and is at par with that of a centralized data setup makes a strong case for extending our technique across other architectures and tasks. The solution finds its application in organizations that want to train deep learning models on vertically partitioned data.

研究の動機と目的

  • 複数の組織に分散された機微な個人および金融データがある状況で、ディープラーニングモデルをトレーニングする際のデータプライバシー課題に対処すること。
  • 生データを共有せずに、異なるノードに分散された特徴(垂直分割データ)上で効果的なモデルトレーニングを可能にすること。
  • EthereumスマートコントラクトとIPFSを用いて、中間モデル表現の交換に役立てる安全で分散型のアグリゲーションメカニズムを設計すること。
  • 分散ノードからの特徴を統合したホストモデルが、中央に集約されたモデルと同等の性能を示すことを実証すること。
  • 金融、医療、その他のデータ感受性の高い分野に適用可能なスケーラブルでプライバシー保護型のソリューションを提供すること。

提案手法

  • 各ノードで、個人情報は1つのノード、銀行固有の情報は別のノードで、それぞれのデータを用いて局所的な人工ニューラルネットワーク(ANN)モデルを独立してトレーニングする。
  • 各局所モデルの最終隠れ層からの中間特徴表現(活性化)を抽出し、整合性の検証のためハッシュ化する。
  • Ethereumブロックチェーン上のスマートコントラクトが、ノード間でのこれらの特徴ベクトルの安全な交換とアグリゲーションを管理する。
  • アグリゲートされた特徴ベクトルを用いて、中央ノードでホストモデルをトレーニングし、結合された表現をローン結果ラベルにマッピングするように学習させる。
  • IPFSを用いて中間特徴ベクトルおよびテストデータを格納・取得し、分散型で改ざん不能なアクセスを確保する。
  • システムは、生データを一切転送しないで、信頼性のないブロックチェーン層を通じて暗号化・ハッシュ化された表現のみを交換することで、データプライバシーを確保する。

実験結果

リサーチクエスチョン

  • RQ1垂直に分割されたデータからの特徴表現でトレーニングされたディープラーニングモデルは、中央集権的トレーニングと同等のパフォーマンスを達成できるか?
  • RQ2中間特徴をアグリゲートして使用する場合、分散型モデルの収束速度は中央集権的モデルと比べてどの程度か?
  • RQ3ブロックチェーンベースのスマートコントラクトシステムは、分散モデル表現のアグリゲーションにおいて、セキュリティと整合性をどの程度保証できるか?
  • RQ4提案されたメカニズムは、バンクや金融などの感受性の高い分野で、高いモデル精度を維持しながらデータプライバシーを保護できるか?
  • RQ5複数のソースからの特徴アグリゲーションが、F1スコアやAUCなどのパフォーマンス指標およびモデルの一般化性能に及ぼす影響は何か?

主な発見

  • 提案された分散型モデルは、テストセットでF1スコア0.95、正解率98.13%を達成し、中央集権的モデルのF1スコア0.95、正解率98.33%と非常に近い性能を示した。
  • トレーニング損失と正解率のエポックごとの曲線から、分散型モデルが中央集権的モデルよりも高速に収束したことが確認された。
  • 個々の局所モデル(個人情報ノードではF1スコア0.67、銀行固有情報ノードでは0.63)の性能に比べ、アグリゲートされたモデルの性能は著しく優れていた。
  • 分散型と中央集権的環境との間で、精度、再現率、F1スコアの指標がほぼ同一であり、正解率差が0.2%未満にとどまった。
  • スマートコントラクトとIPFSの使用により、生データを露呈せずに、安全で監査可能で改ざん不能な中間表現の交換が実現した。
  • 垂直分割データと安全で分散型の特徴アグリゲーションを組み合わせることで、モデル性能が低下しないことが結果から裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。