[论文解读] Towards Analytics Aware Ontology Based Access to Static and Streaming Data (Extended Version)
本文提出了一种面向分析的本体基础数据访问(OBDA)扩展,原生支持聚合函数、相关性操作和流数据处理。通过将分析函数直接集成到本体和查询语言中,并采用基于成本的查询优化,该方法实现了对异构静态数据和流数据的高效、声明式分析——在西门子的实际涡轮机诊断中得到验证,将查询复杂度从数百个减少为单一本体查询。
Real-time analytics that requires integration and aggregation of heterogeneous and distributed streaming and static data is a typical task in many industrial scenarios such as diagnostics of turbines in Siemens. OBDA approach has a great potential to facilitate such tasks; however, it has a number of limitations in dealing with analytics that restrict its use in important industrial applications. Based on our experience with Siemens, we argue that in order to overcome those limitations OBDA should be extended and become analytics, source, and cost aware. In this work we propose such an extension. In particular, we propose an ontology, mapping, and query language for OBDA, where aggregate and other analytical functions are first class citizens. Moreover, we develop query optimisation techniques that allow to efficiently process analytical tasks over static and streaming data. We implement our approach in a system and evaluate our system with Siemens turbine data.
研究动机与目标
- 解决传统OBDA在处理涉及聚合、相关性和流数据的分析查询时的局限性。
- 支持声明式、高层级的本体查询,以表达复杂分析,而无需编写针对底层数据源的查询。
- 减少工业应用(如涡轮机监控)中诊断工作流的时间和复杂度。
- 开发利用数据源能力并最小化数据传输的查询优化技术。
- 将基于本体的访问与现代数据流管理系统(DSMS)集成,以支持实时分析。
提出的方法
- 扩展DL-Lite_A^agg本体语言,以原生支持聚合函数(如min、mean)和相关性操作作为一等公民。
- 引入一种查询语言,允许在本体查询中直接表达分析函数,从而与特定数据源的语法解耦。
- 设计一种查询重写策略,尽可能将分析操作下推至数据源,利用预计算的聚合结果。
- 采用基于成本的优化,选择高效的执行计划,以最小化数据传输和计算开销。
- 与数据流管理系统(DSMS)如ExaStream集成,以支持对流式传感器数据的持续、实时处理。
- 将数据仓库中的物化窗口签名技术适配用于流数据和历史数据的高效汇总。
实验结果
研究问题
- RQ1如何扩展OBDA以原生支持本体查询中的分析函数(如聚合和相关性)?
- RQ2在异构、分布式环境中,将分析操作下推至数据源的性能影响是什么?
- RQ3统一的基于本体的接口能否减少工业诊断工作流中所需查询的数量?
- RQ4在处理混合静态和流数据时,基于成本的查询优化如何提升效率?
- RQ5针对实时和归档数据流的复杂分析,哪些优化技术能有效加速处理?
主要发现
- 在西门子涡轮机诊断中,该方法将所需查询数量从数百个减少为单一本体查询。
- 通过将分析操作下推至数据源,系统实现了显著的性能提升,避免了完整数据的检索,并可利用预计算的聚合结果。
- 与ExaStream的集成实现了对流式传感器数据的高效、连续处理,结合物化窗口摘要。
- 基于真实西门子涡轮机数据的评估证明了该方法在大规模工业环境中的可行性和高效性。
- 该框架支持在本体层直接表达复杂分析(如皮尔逊相关性、基于阈值的过滤),提升了表达能力和可维护性。
- 初步结果表明,近似算法和预计算的物化结构可进一步加速查询执行,同时保持结果质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。