Skip to main content
QUICK REVIEW

[論文レビュー] DataBright: Towards a Global Exchange for Decentralized Data Ownership and Trusted Computation

David Dao, Dan Alistarh|arXiv (Cornell University)|Feb 13, 2018
Blockchain Technology Applications and Security参考文献 3被引用数 11
ひとこと要約

DataBrightは、データと信頼できる計算の分散型グローバル交換を提案し、データ貢献者がそのデータやハードウェアが機械学習のトレーニングに使用された際に配当を獲得できる株主としての立場を果たせるようにする。EthereumベースのスマートコントラクトとIntel SGXによる信頼実行、およびハイブリッド検証(TMR、モデル分割)を組み合わせることで、最小限のパフォーマンスオーバーヘッドで検証可能でプライバシー保護された計算を実現する。2つのGPUを用いた2路モデル分割によるVGG-16トレーニングでは、225分で実証された。

ABSTRACT

It is safe to assume that, for the foreseeable future, machine learning, especially deep learning will remain both data- and computation-hungry. In this paper, we ask: Can we build a global exchange where everyone can contribute computation and data to train the next generation of machine learning applications? We present an early, but running prototype of DataBright, a system that turns the creation of training examples and the sharing of computation into an investment mechanism. Unlike most crowdsourcing platforms, where the contributor gets paid when they submit their data, DataBright pays dividends whenever a contributor's data or hardware is used by someone to train a machine learning model. The contributor becomes a shareholder in the dataset they created. To enable the measurement of usage, a computation platform that contributors can trust is also necessary. DataBright thus merges both a data market and a trusted computation market. We illustrate that trusted computation can enable the creation of an AI market, where each data point has an exact value that should be paid to its creator. DataBright allows data creators to retain ownership of their contribution and attaches to it a measurable value. The value of the data is given by its utility in subsequent distributed computation done on the DataBright computation market. The computation market allocates tasks and subsequent payments to pooled hardware. This leads to the creation of a decentralized AI cloud. Our experiments show that trusted hardware such as Intel SGX can be added to the usual ML pipeline with no additional costs. We use this setting to orchestrate distributed computation that enables the creation of a computation market. DataBright is available for download at https://github.com/ds3lab/databright.

研究の動機と目的

  • 機械学習のための従来のクラウドソーシングやクラウドコンピューティングにおけるインcentive不足と所有権の欠如を是正すること。
  • データ貢献者が所有権を保持し、そのデータやハードウェアが使用された際に配当を獲得できる分散型マーケットを構築すること。
  • ハイブリッド検証技術を用いて、信頼できないハードウェアでも信頼できる計算を可能にすること。
  • データプライバシーと整合性を保ちながら、信頼できる計算におけるパフォーマンスオーバーヘッドを低減すること。
  • 信頼できるハードウェアが標準的なMLパイプラインに最小限のランタイムコストで統合可能であることを実証すること。

提案手法

  • Ethereumスマートコントラクトを用いて分散型データマーケットを実装し、貢献者がデータプロポーザルを提出し、mintedトークンを通じて株主として参加できるようにする。
  • データキュレーターは計算用トークンを用いてプロポーザルに投票し、承認されたデータはブロックチェーン上に改ざん不能なレジストリに保存される。
  • 信頼できる計算マーケットは、Intel SGX対応デバイスを用いて、信頼できないGPU上で計算をスケジューリングおよび検証する。検証には三重モジュラー再冗長性(TMR)を用いる。
  • モデル分割によりニューラルネットワークを信頼できないワーカーに分散させ、完全なモデルの露呈を防ぐ。各レイヤー間で活性化および勾配の通信が行われる。
  • 定期的な再割り当てにより、各信頼できないワーカーが露出するデータ量をトレーニングデータセット全体の5%以内に制限する。
  • パフォーマンスオーバーヘッドは、1〜2台のGPUを用いたImageNet上のVGG-16を用いて測定され、標準、分割、TMR設定の比較が行われる。

実験結果

リサーチクエスチョン

  • RQ1長期的な所有権と配当報酬に基づくインcentiveによって、データ貢献者が高品質なデータを提供する仕組みはどのように実現できるか?
  • RQ2信頼できると信頼できないハードウェアのハイブリッドモデルが、許容可能なパフォーマンスオーバーヘッドで検証可能な機械学習トレーニングを可能にするか?
  • RQ3信頼できない計算リソースを使用する際、データプライバシーを確保し漏洩を防ぐメカニズムは何か?
  • RQ4分散型・分散型の環境下で、モデル分割がトレーニングのパフォーマンスと通信コストにどのように影響を与えるか?
  • RQ5Intel SGXのような信頼できるハードウェアが、顕著なパフォーマンス劣化を伴わずに標準的なディープラーニングパイプラインにどの程度統合可能か?

主な発見

  • Intel SGXを用いたスケジューリングと送信処理は、2路分割設定において1回の実行あたりわずか93msのオーバーヘッドにとどまった。
  • 2つのGPUを用いた2路モデル分割によるVGG-16トレーニングは225分で完了したが、これは標準的な単一GPUトレーニングの193分と比較してわずかに遅延した。
  • 三重モジュラー再冗長性(TMR)は、信頼できないワーカー上で検証可能な計算を実現するにあたり、おおよそ3倍のオーバーヘッドをもたらした。
  • TMRを併用したモデル分割は、合計で約6倍のオーバーヘッドをもたらしたが、著者らは最適化によりこれを低減可能であると見ている。
  • 通信オーバーヘッドは、特に非分割設定において、1Gbpsの遅いネットワークリンクが原因でマルチノード環境で顕著に顕在した。
  • 本システムは、信頼できるハードウェアが標準的なMLパイプラインに最小限のパフォーマンスコストで統合可能であることを実証し、分散型AIクラウドの実現を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。