Skip to main content
QUICK REVIEW

[論文レビュー] The Tensor Data Platform: Towards an AI-centric Database System

Apurva Gandhi, Yuki Asada|arXiv (Cornell University)|Nov 4, 2022
Graph Theory and Algorithms被引用数 8
ひとこと要約

本稿では、関係モデルに代わるテンソル抽象化を用いることで、マルチモーダルデータ、ハードウェアアクセラレーション、自動微分を用いたトレーニング可能なクエリをネイティブにサポートするAI指向データベースシステム、Tensor Data Platform (TDP) を提案する。PyTorchと密接に統合することで、従来のエンドツーエンドのディープラーニングモデルと比較して、優れたトレーニング効率とモデル一般化性能を実現する、ハイブリッドなSQL-MLワークロードを効率的かつ宣言的に行える。

ABSTRACT

Database engines have historically absorbed many of the innovations in data processing, adding features to process graph data, XML, object oriented, and text among many others. In this paper, we make the case that it is time to do the same for AI -- but with a twist! While existing approaches have tried to achieve this by integrating databases with external ML tools, in this paper we claim that achieving a truly AI-centric database requires moving the DBMS engine, at its core, from a relational to a tensor abstraction. This allows us to: (1) support multi-modal data processing such as images, videos, audio, text as well as relational; (2) leverage the wellspring of innovation in HW and runtimes for tensor computation; and (3) exploit automatic differentiation to enable a novel class of "trainable" queries that can learn to perform a task. To support the above scenarios, we introduce TDP: a system that builds upon our prior work mapping relational queries to tensors. Thanks to a tighter integration with the tensor runtime, TDP is able to provide a broader coverage of new emerging scenarios requiring access to multi-modal data and automatic differentiation.

研究の動機と目的

  • 画像、音声、動画などの非関係的でマルチモーダルなデータを処理する伝統的なデータベースの限界を解消すること。
  • 外部UDFやSQL埋め込みモデルとしてMLワークロードを統合する際のパフォーマンスおよび統合のボトルネックを克服すること。
  • テンソル計算ランタイム(例:PyTorch)のイノベーションエコシステムを活用し、データベースエンジン内でのハードウェアアクセラレーション、自動微分、モデルトレーニングを実現すること。
  • SQLとML機能を統合した一貫性のある宣言的インターフェースを提供し、データサイエンティストがSQLのみのワークフローに強制されないようにすること。
  • テンソルベースのデータベースが、レガシーリレーショナルワークロードと、ベクトル検索や動画分析のような新しいAIネイティブワークロードを効率的に処理できることを示すこと。

提案手法

  • リレーショナルデータ、テキスト、画像、音声、ベクトルを含むすべてのデータを、カラムストレージモデル内での統一されたテンソル抽象化で表現すること。
  • PyTorchのランタイム上にクエリプロセッサを構築することで、CPU、GPU、および専用アクセラレータ(例:TPU、IPU)を横断したハードウェアアクセラレーションを実現すること。
  • TQPシステムを拡張し、結合、集計、ユーザー定義関数(UDF)を含む、テンソル上の完全なSQLに類似した宣言的クエリをサポートすること。
  • ニューラルネットワーク(例:CNN)をSQLに類似した式に直接埋め込み、PyTorchの自動微分を活用してエンドツーエンドのトレーニングを可能にする、トレーニング可能なクエリの実装。
  • 画像やテキストなどの多様なデータタイプを高密度ベクトル埋め込みに変換することで、マルチモーダルデータ処理を可能にし、これらをクエリ言語の一次的市民として扱えるようにすること。
  • Jupyter Notebook、Pandas、NumPy、TensorBoardなどのMLツールとシームレスに統合し、スタック全体のデータサイエンスワークロードを支援すること。

実験結果

リサーチクエスチョン

  • RQ1テンソル計算ランタイム上で構築されたデータベースシステムは、従来のリレーショナルデータベースに比べ、マルチモーダルおよびAIネイティブワークロードの処理で優れたパフォーマンスを発揮できるか?
  • RQ2PyTorchのようなディープラーニングフレームワークとの密接な統合は、ハイブリッドなSQL-MLクエリのパフォーマンスと使いやすさにどのように影響するか?
  • RQ3クエリ論理に学習可能なコンponentsを含むトレーニング可能なクエリは、タスク間でどれほど一般化され、高い正確性を維持できるか?
  • RQ4一貫したシステムが、パフォーマンスや表現力の劣化を伴わずに、レガシーリレーショナル処理と現代のAIワークロードの両方を効率的にサポートできるか?
  • RQ5複雑なハイブリッドデータ処理タスクの最適化に、データベースエンジン内で自動微分を活用することによる実用的利点は何か?

主な発見

  • TDPアプローチは、MNISTGridタスクにおいて40,000回のトレーニングイテレーションでほぼゼロのテスト誤差を達成し、小規模なCNN(850Kパラメータ)およびResNet-18(11.1Mパラメータ)と比較して収束速度と最終的な正確性の両面で顕著に優れていた。
  • TDPクエリから抽出されたトレーニング済みのdigit_parser CNNコンponentは、MNISTラベルを明示的に学習せずともMNISTデータセットで98.15%の分類正確性を達成し、優れた一般化性能と再利用可能性を示した。
  • PyTorchとの密接な統合により、SQL操作とML操作の間のコンテキストスイッチングのオーバーヘッドが解消され、多様なハードウェア上で複雑なハイブリッドクエリが効率的に実行可能になった。
  • TDPは、すべてのデータタイプをテンソルとして表現することで、マルチモーダルデータ処理をネイティブにサポートし、1つのクエリ内で画像、テキスト、リレーショナルデータの間でシームレスな操作を可能にした。
  • TDPは、SQLとMLを統合した新しいプログラミングモデルを提供し、データサイエンティストにとって表現力があり、かつ使いやすいものであり、モデルをSQLに再実装する必要や、慣れ親しんだツールを放棄する必要がなくなった。
  • TDPは、バックプロパゲーションによる最適化が可能な新しいクラスのトレーニング可能なクエリをサポートしており、データベースエンジンが最適なクエリ実行戦略やデータ変換を学習できるようにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。