Skip to main content
QUICK REVIEW

[論文レビュー] Cognitive Database: A Step towards Endowing Relational Databases with Artificial Intelligence Capabilities

Rajesh Bordawekar, Bortik Bandyopadhyay|arXiv (Cornell University)|Dec 19, 2017
Semantic Web and Ontologies参考文献 52被引用数 19
ひとこと要約

この論文は、データベース由来のテキストから得られる教師なし単語埋め込みを活用することで、関係データベースにAI機能を付与する、Cognitive Databases(認知データベース)と呼ばれる革新的な手法を紹介する。構造化データを意味的ベクトルに変換することで、意味的マッチング、帰納的推論、外部知識統合をサポートする新しいクラスのSQLベースの認知的インテリジェンス(CI)クエリを可能にする。これは、マルチモーダルデータを対象としたApache Sparkプロトタイプによって実証された。

ABSTRACT

We propose Cognitive Databases, an approach for transparently enabling Artificial Intelligence (AI) capabilities in relational databases. A novel aspect of our design is to first view the structured data source as meaningful unstructured text, and then use the text to build an unsupervised neural network model using a Natural Language Processing (NLP) technique called word embedding. This model captures the hidden inter-/intra-column relationships between database tokens of different types. For each database token, the model includes a vector that encodes contextual semantic relationships. We seamlessly integrate the word embedding model into existing SQL query infrastructure and use it to enable a new class of SQL-based analytics queries called cognitive intelligence (CI) queries. CI queries use the model vectors to enable complex queries such as semantic matching, inductive reasoning queries such as analogies, predictive queries using entities not present in a database, and, more generally, using knowledge from external sources. We demonstrate unique capabilities of Cognitive Databases using an Apache Spark based prototype to execute inductive reasoning CI queries over a multi-modal database containing text and images. We believe our first-of-a-kind system exemplifies using AI functionality to endow relational databases with capabilities that were previously very hard to realize in practice.

研究の動機と目的

  • 従来のSQLが、関係データベース内の多様なデータ型にわたる潜在的意味的関係を捉えることの限界を解消すること。
  • WordNet や同義語辞書などの外部知識ソースに依存せずに、AI駆動のクエリ機能を実現すること。
  • 教師なしNLP技術を用いて意味的関係を符号化することで、関係データに対して包括的かつ文脈に配慮した視点を提供すること。
  • 関係データベースに、帰納的推論と意味的類似性を扱える新しいクラスの分析クエリ—認知的インテリジェンス(CI)クエリ—を拡張すること。
  • Apache Sparkプロトタイプを用いて、マルチモーダルデータ(テキストおよび画像)を対象としたCIクエリの実現可能性と表現力の両面を実証すること。

提案手法

  • データベーススキーマおよびインスタンスデータ(テキスト、数値、日付、画像を含む)をNLP処理の対象となる意味的意味を持つ非構造化テキストとして扱う。
  • スキャン・グラムやCBOWなどの単語埋め込み技術を適用し、列内および列間の意味的関係を符号化する密なベクトル表現を生成する。
  • 学習済みの単語埋め込みモデルをSQLクエリ実行エンジンに直接統合し、ベクトルベースの意味的演算を可能にする。
  • ベクトル類似度を用いた意味的マッチング、類似的推論、未観測エンティティに対する予測推論をサポートするCIクエリを実装する。
  • 外部知識ベース(例:Wikipedia)の埋め込みを、データベースが学習したベクトルと一致させることで、それらの統合を可能にする。
  • 大規模でマルチモーダルなデータベースにおけるスケーラブルな学習と推論をサポートするため、Apache Spark上にシステムを実装する。

実験結果

リサーチクエスチョン

  • RQ1教師なしNLP技術(例:単語埋め込み)を用いて、関係データベース内の潜在的意味的関係を効果的に捉えることができるか?
  • RQ2データベースのコンテンツから得られる単語埋め込みは、従来の値ベースの述語を越えて、どのような新しい形式のSQLベースの分析を可能にするのか?
  • RQ3意味的ベクトルは、データベースに存在しないエンティティの類似的クエリや予測を実現する帰納的推論タスクをどのように支援できるか?
  • RQ4外部知識ソースは、データベース由来の埋め込みとシームレスに統合可能か?その統合によりクエリの表現力が向上するか?
  • RQ5標準的なSQLクエリエンジンに学習済み意味的ベクトルを統合する際のパフォーマンスおよびスケーラビリティ特性は何か?

主な発見

  • 提案されたCognitive Databaseシステムは、CIクエリを介して意味的マッチングと帰納的推論を実現し、ユーザーが明示的なスキーマやジョイン論理なしに、ジョン・ドリトルに「最も関連性の高い」従業員を特定できるようにした。
  • システムは、データベースに存在しないエンティティについての予測クエリをサポートしており、例えば「事故」や「死亡」といった用語に関する外部知識を用いて、危険なバケーションパッケージを特定することができる。
  • プロトタイプは、Apache Sparkを用いてマルチモーダルデータ(テキストおよび画像)上で複雑なCIクエリを実行可能であることを実証し、意味的推論がSQLベースのシステムにネイティブに統合可能であることを示した。
  • このアプローチは、WordNet や同義語辞書などの外部語彙リソースに依存しないため、ドメイン固有のデータに適応可能な自己完結型である。
  • データベースのトークンを意味的文脈を符号化するベクトルとして表現することで、データに対して関係的かつ意味的という二重の視点を提供する。
  • 著者らは、モデルが数値、文字列、日付、画像を含む多様なデータ型間で、統一された埋め込み空間を介して文法的および意味的関係を捉えられると報告している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。