Skip to main content
QUICK REVIEW

[论文解读] Optimizing real-time RDF data streams

Joshua Shinavier|arXiv (Cornell University)|Nov 16, 2010
Caching and Content Delivery参考文献 12被引用 5
一句话总结

本文提出了一种基于UDP的高吞吐量、低延迟架构,用于实时RDF数据流处理,展示了其在大规模数据处理中的能力——实现约每秒930条推文的吞吐量,接近Twitter Firehose的数据速率,通过无损压缩和高效的RDF更新处理实现。该系统支持对高速RDF流的实时查询,验证了语义网技术在高性能、实时应用场景中的可行性。

ABSTRACT

The Resource Description Framework (RDF) provides a common data model for the integration of "real-time" social and sensor data streams with the Web and with each other. While there exist numerous protocols and data formats for exchanging dynamic RDF data, or RDF updates, these options should be examined carefully in order to enable a Semantic Web equivalent of the high-throughput, low-latency streams of typical Web 2.0, multimedia, and gaming applications. This paper contains a brief survey of RDF update formats and a high-level discussion of both TCP and UDP-based transport protocols for updates. Its main contribution is the experimental evaluation of a UDP-based architecture which serves as a real-world example of a high-performance RDF streaming application in an Internet-scale distributed environment.

研究动机与目标

  • 解决在社交媒体和传感器等高速数据源中实时RDF数据流处理的性能与可扩展性挑战。
  • 评估基于UDP的传输协议作为HTTP流式传输在RDF更新中的替代方案的可行性。
  • 展示一种高吞吐量、低延迟的RDF流处理管道,能够处理与Twitter Firehose相当规模的数据量。
  • 评估无损数据压缩和高效更新格式在最大化吞吐量和最小化延迟方面的作用。
  • 提供一种实际的、开源的可扩展RDF流系统实现,适用于真实环境的部署。

提出的方法

  • 设计并实现一种基于UDP的流式架构,用于通过无损压缩减少负载大小,实现实时RDF数据摄取。
  • 使用SPARQL/Update和Delta本体格式表达RDF更新,优先考虑紧凑性和高效解析。
  • 部署一个客户端-服务器管道,单个客户端机器通过UDP将RDF更新推送到远程高性能三元组存储服务器。
  • 通过每UDP数据包批量处理多个RDF语句并最小化协议开销来优化吞吐量。
  • 使用标准化基准测试性能:在多个接收进程上以相当于Twitter Firehose的数据速率摄取数据。
  • 在接收端使用多进程处理,并评估不同线程数(1至8)下的吞吐量和延迟。

实验结果

研究问题

  • RQ1在实时RDF数据流中,基于UDP的传输是否能在吞吐量和延迟方面优于传统的HTTP传输协议?
  • RQ2使用现代语义网技术和高效传输协议,实时RDF数据摄取的最大可实现吞吐量是多少?
  • RQ3无损数据压缩在大规模RDF流处理工作负载中的性能影响如何?
  • RQ4基于UDP的分布式系统在多大程度上可以实现接近实时的大规模数据摄取,例如Twitter Firehose的数据量?
  • RQ5在实现高速RDF流上的可扩展、低延迟查询支持方面,哪些架构和协议选择最为有效?

主要发现

  • 基于UDP的系统实现了约每秒930条推文的稳定摄取速率,与Twitter Firehose的估算数据量非常接近。
  • 当使用四个接收进程时,最大吞吐量达到约980笔事务/秒,表明已接近最优地消耗了输入数据流。
  • 在八个接收线程的情况下,最低吞吐量仍保持在理论上限的90%以上,表明系统具有出色的可扩展性和高效的负载分配能力。
  • 系统成功地实时将RDF更新提交到远程三元组存储中,通过SPARQL端点实现即时查询访问。
  • 无损数据压缩被证明在各种底层传输协议下均能持续提升性能。
  • 结果验证了,当经过适当优化时,当前的语义网技术能够支持互联网规模的高性能、实时数据工作负载。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。