Skip to main content
QUICK REVIEW

[논문 리뷰] Cognitive Database: A Step towards Endowing Relational Databases with Artificial Intelligence Capabilities

Rajesh Bordawekar, Bortik Bandyopadhyay|arXiv (Cornell University)|2017. 12. 19.
Semantic Web and Ontologies참고 문헌 52인용 수 19
한 줄 요약

이 논문은 데이터베이스에서 유래한 텍스트로부터 비지도 학습 단어 임베딩을 활용하여 관계형 데이터베이스에 인공지능 기능을 부여하는 새로운 접근법인 인지 데이터베이스(Cognitive Databases)를 소개한다. 구조화된 데이터를 의미 벡터로 변환함으로써, 의미 매칭, 유추 추론, 외부 지식 통합을 지원하는 새로운 종류의 SQL 기반 인지지능(CI) 쿼리가 가능해지며, 이는 다중 모odal 데이터를 대상으로 한 Apache Spark 프로토타입을 통해 입증되었다.

ABSTRACT

We propose Cognitive Databases, an approach for transparently enabling Artificial Intelligence (AI) capabilities in relational databases. A novel aspect of our design is to first view the structured data source as meaningful unstructured text, and then use the text to build an unsupervised neural network model using a Natural Language Processing (NLP) technique called word embedding. This model captures the hidden inter-/intra-column relationships between database tokens of different types. For each database token, the model includes a vector that encodes contextual semantic relationships. We seamlessly integrate the word embedding model into existing SQL query infrastructure and use it to enable a new class of SQL-based analytics queries called cognitive intelligence (CI) queries. CI queries use the model vectors to enable complex queries such as semantic matching, inductive reasoning queries such as analogies, predictive queries using entities not present in a database, and, more generally, using knowledge from external sources. We demonstrate unique capabilities of Cognitive Databases using an Apache Spark based prototype to execute inductive reasoning CI queries over a multi-modal database containing text and images. We believe our first-of-a-kind system exemplifies using AI functionality to endow relational databases with capabilities that were previously very hard to realize in practice.

연구 동기 및 목표

  • 기존 SQL이 다양한 데이터 유형 간 잠재적 의미 관계를 포괄하지 못하는 한계를 해결하기 위해.
  • WordNet이나 동의어사전과 같은 외부 지식 소스에 의존하지 않고도 AI 기반 쿼리 기능을 제공하기 위해.
  • 비지도 NLP 기법을 통해 의미 관계를 인코딩함으로써 관계형 데이터에 대한 통합적이고 맥락 인식 가능한 시각을 제공하기 위해.
  • 유도적 추론과 의미 유사도를 수행할 수 있는 새로운 종류의 분석 쿼리—인지지능(CI) 쿼리—를 관계형 데이터베이스에 통합하기 위해.
  • 다중 모달 데이터(텍스트 및 이미지)를 대상으로 한 Apache Spark 프로토타입을 통해 CI 쿼리의 실현 가능성과 표현력을 입증하기 위해.

제안 방법

  • 텍스트, 숫자, 날짜, 이미지를 포함한 데이터베이스 스키마 및 인스턴스 데이터를 자연어 처리(NLP)를 위한 의미 있는 비구조화된 텍스트로 간주하기.
  • 스킵그램 또는 CBOW와 같은 단어 임베딩 기법을 적용하여 상호 및 내부 컬럼 간 의미 관계를 인코딩하는 조밀한 벡터 표현 생성하기.
  • 학습된 단어 임베딩 모델을 SQL 쿼리 실행 엔진에 직접 통합하여, 벡터 기반 의미 연산을 가능하게 하기.
  • 벡터 유사도를 사용하여 의미 매칭, 유사 유추 추론, 그리고 미존재하는 엔티티에 대한 예측 추론을 지원하는 CI 쿼리 지원하기.
  • 외부 지식 기반(예: 위키백과)의 임베딩을 데이터베이스가 학습한 벡터와 정렬함으로써 외부 지식 기반을 통합하기.
  • 대규모 다중 모달 데이터베이스에서의 확장 가능한 학습 및 추론을 지원하기 위해 Apache Spark 기반으로 시스템을 구현하기.

실험 결과

연구 질문

  • RQ1비지도 NLP 기법인 단어 임베딩을 사용하여 관계형 데이터베이스 내 잠재적 의미 관계를 효과적으로 포착할 수 있는가?
  • RQ2데이터베이스 컨텐츠에서 유도된 단어 임베딩가 기존의 값 기반 조건을 초월한 새로운 종류의 SQL 기반 분석을 얼마나 잘 가능하게 하는가?
  • RQ3의미 벡터는 어떻게 존재하지 않는 엔티티에 대한 유추 추론 작업(예: 유사성 쿼리, 예측)을 지원할 수 있는가?
  • RQ4외부 지식 소스는 데이터베이스에서 유도된 임베딩과 원활하게 통합되어 쿼리 표현력을 향상시킬 수 있는가?
  • RQ5표준 SQL 쿼리 엔진에 학습된 의미 벡터를 통합할 경우 성능 및 확장성 특성은 어떠한가?

주요 결과

  • 제안된 인지 데이터베이스 시스템은 CI 쿼리를 통해 의미 매칭과 유도적 추론을 성공적으로 구현하여, 명시적 스키마나 조인 로직 없이도 존 돌리틀과 가장 유사한 직원을 찾는 등의 작업을 수행할 수 있다.
  • 시스템은 데이터베이스에 존재하지 않는 엔티티에 대해서도 예측 쿼리를 지원하며, 예를 들어 '사고'나 '사망'과 같은 용어에 대해 외부 지식을 기반으로 위험한 해외 여행 패키지를 식별하는 데 성공했다.
  • 프로토타입은 Apache Spark를 활용하여 다중 모달 데이터(텍스트 및 이미지)에서 복잡한 CI 쿼리를 실행할 수 있음을 입증하였으며, 의미 추론이 SQL 기반 시스템에 내재적으로 통합될 수 있음을 보여주었다.
  • 이 방법은 WordNet이나 동의어사전과 같은 외부 어휘 자원에 의존하지 않아 도메인 특화 데이터에 대해 자체적으로 구축되고 유연하게 적용 가능한 특성을 지닌다.
  • 데이터베이스 토큰을 맥락적 의미를 인코딩하는 벡터로 표현함으로써, 데이터에 대해 관계형과 의미적 두 가지 시각을 제공한다.
  • 저자들은 모델이 숫자 값, 문자열, 날짜, 이미지 등 다양한 데이터 유형 간의 문법적 및 의미적 관계를 통합된 임베딩 공간을 통해 효과적으로 포착한다고 보고했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.