[论文解读] Big Data Model "Entity and Features"
本文提出了一种名为“实体与特征”的大数据模型,以解决在无需预先整合的情况下,集成异构、动态数据源的挑战。通过独立建模实体及其特征,该框架能够高效计算数据源之间的相似性与距离,支持在基于NoSQL的分布式环境中处理非结构化和半结构化数据的决策支持。
The article deals with the problem which led to Big Data. Big Data information technology is the set of methods and means of processing different types of structured and unstructured dynamic large amounts of data for their analysis and use of decision support. Features of NoSQL databases and categories are described. The developed Big Data Model "Entity and Features" allows determining the distance between the sources of data on the availability of information about a particular entity. The information structure of Big Data has been devised. It became a basis for further research and for concentrating on a problem of development of diverse data without their preliminary integration.
研究动机与目标
- 解决在无需预先数据融合或模式对齐的情况下,集成多样化、动态且异构的大数据源的挑战。
- 开发一种可扩展的信息模型,支持NoSQL环境中结构化与非结构化数据。
- 基于共享实体特征,实现数据源之间的有效比较与相似性检测。
- 为去中心化数据处理与基于特征的数据匹配的未来研究提供基础。
- 通过保留数据多样性,同时支持跨源分析,为决策支持系统提供支持。
提出的方法
- 提出以“实体”和“特征”作为原子抽象单元的概念数据模型,将数据语义与存储结构解耦。
- 将特征定义为与实体相关联的属性或描述符,支持结构化与非结构化数据类型。
- 将数据源建模为实体及其关联特征的集合,支持跨源的特征级别比较。
- 利用特征重叠与相似性度量方法计算数据源之间的距离,量化其信息接近程度。
- 设计模型以兼容NoSQL数据库,支持分布式、可扩展且灵活的数据处理。
- 采用类似图的实体-特征关系表示,以支持高效查询与相似性计算。
实验结果
研究问题
- RQ1如何在无需预先整合或模式对齐的情况下,比较具有异构结构的大数据源?
- RQ2何种概念模型能够有效表示NoSQL环境中多样化数据类型下的实体及其特征?
- RQ3如何基于共享特征,对数据源之间的相似性或距离进行定量测量?
- RQ4基于特征的建模在支持去中心化、大规模数据系统中的决策支持中起到何种作用?
- RQ5所提出的模型如何在保留数据多样性的同时,实现跨源分析与集成?
主要发现
- “实体与特征”模型成功将实体数据与其特征描述符解耦,实现了模块化与可扩展的数据建模。
- 该模型支持结构化与非结构化数据,适用于广泛的大数据工作负载。
- 通过特征重叠,可实现数据源之间的距离计算,提供数据相似性的量化度量。
- 该模型无需数据集成即可支持决策支持,同时保留了数据完整性和多样性。
- 该框架与NoSQL数据库兼容,支持分布式、并行与集群计算环境。
- 该方法为未来基于特征的数据匹配与去中心化数据分析研究提供了基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。