Skip to main content
QUICK REVIEW

[论文解读] Cognitive Database: A Step towards Endowing Relational Databases with Artificial Intelligence Capabilities

Rajesh Bordawekar, Bortik Bandyopadhyay|arXiv (Cornell University)|Dec 19, 2017
Semantic Web and Ontologies参考文献 52被引用 19
一句话总结

本文提出认知数据库(Cognitive Databases),一种新颖的方法,通过利用从数据库中提取的文本生成的无监督词嵌入,为关系型数据库赋予人工智能能力。通过将结构化数据转换为语义向量,该方法支持一类新型基于SQL的认知智能(CI)查询,具备语义匹配、归纳推理和外部知识融合能力——已在基于Apache Spark的多模态数据原型系统中得到验证。

ABSTRACT

We propose Cognitive Databases, an approach for transparently enabling Artificial Intelligence (AI) capabilities in relational databases. A novel aspect of our design is to first view the structured data source as meaningful unstructured text, and then use the text to build an unsupervised neural network model using a Natural Language Processing (NLP) technique called word embedding. This model captures the hidden inter-/intra-column relationships between database tokens of different types. For each database token, the model includes a vector that encodes contextual semantic relationships. We seamlessly integrate the word embedding model into existing SQL query infrastructure and use it to enable a new class of SQL-based analytics queries called cognitive intelligence (CI) queries. CI queries use the model vectors to enable complex queries such as semantic matching, inductive reasoning queries such as analogies, predictive queries using entities not present in a database, and, more generally, using knowledge from external sources. We demonstrate unique capabilities of Cognitive Databases using an Apache Spark based prototype to execute inductive reasoning CI queries over a multi-modal database containing text and images. We believe our first-of-a-kind system exemplifies using AI functionality to endow relational databases with capabilities that were previously very hard to realize in practice.

研究动机与目标

  • 解决传统SQL在捕捉关系型数据库中多样化数据类型之间潜在语义关系方面的局限性。
  • 在不依赖外部知识源(如WordNet或同义词词典)的前提下,实现基于AI的查询功能。
  • 通过无监督NLP技术编码语义关系,为关系型数据提供全面且上下文感知的视图。
  • 为关系型数据库扩展一类新型分析查询——认知智能(CI)查询,支持归纳推理和语义相似性计算。
  • 通过基于Apache Spark的原型系统,展示在多模态数据(文本与图像)上CI查询的可行性和表达能力。

提出的方法

  • 将数据库模式和实例数据(包括文本、数字、日期和图像)视为有意义的非结构化文本,用于NLP处理。
  • 应用词嵌入技术(如Skip-gram或CBOW)生成密集向量表示,以编码表内及表间语义关系。
  • 将训练好的词嵌入模型直接集成到SQL查询执行引擎中,以支持基于向量的语义操作。
  • 支持使用向量相似度进行语义匹配、类比推理和对未见实体的预测推理的CI查询。
  • 通过将外部知识库(如Wikipedia)的嵌入与数据库学习到的向量对齐,实现外部知识库的使用。
  • 在Apache Spark上实现系统,以支持在大规模多模态数据库上进行可扩展的训练和推理。

实验结果

研究问题

  • RQ1能否通过无监督NLP技术(如词嵌入)有效捕捉关系型数据库中的潜在语义关系?
  • RQ2从数据库内容中提取的词嵌入在多大程度上能够支持超越传统基于值的谓词的新型SQL分析形式?
  • RQ3语义向量如何用于支持归纳推理任务,如类比查询和对数据库中不存在的实体的预测?
  • RQ4能否无缝集成外部知识源与数据库衍生的嵌入,以增强查询的表达能力?
  • RQ5将学习到的语义向量集成到标准SQL查询引擎中时,其性能和可扩展性特征如何?

主要发现

  • 所提出的认知数据库系统通过CI查询成功实现了语义匹配和归纳推理,使用户能够在无需显式模式定义或连接逻辑的情况下,找到与约翰·多利特尔(John Dolittle)‘最相关’的员工。
  • 系统支持对数据库中不存在的实体进行预测查询,例如通过外部知识中关于‘事故’或‘死亡’等术语,识别出危险的度假套餐。
  • 原型系统展示了在基于Apache Spark的多模态数据(文本与图像)上执行复杂CI查询的可行性,表明语义推理可原生集成到基于SQL的系统中。
  • 该方法不依赖外部词汇资源(如WordNet或同义词词典),因此具备自包含性,并能适应特定领域数据。
  • 通过将数据库标记表示为编码上下文意义的向量,该系统实现了数据的双重视图——既为关系型,也为语义型。
  • 作者报告称,该模型通过统一的嵌入空间,成功捕捉了包括数值、字符串、日期和图像在内的多样化数据类型之间的句法与语义关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。