Skip to main content
QUICK REVIEW

[论文解读] TerraServer SAN-Cluster Architecture and Operations Experience

Thomas Barclay, Jim Gray|ArXiv.org|Feb 2, 2005
Advanced Computational Techniques and Applications参考文献 8被引用 6
一句话总结

本文介绍了微软TerraServer的设计与运维经验,该系统是一个基于Windows和SQL Server构建的高可用性、基于PC的SAN集群系统,用于提供17 TB的地理空间影像服务。由4个节点组成的主动/备用集群连接到18 TB的存储区域网络(SAN),在硬件层面实现了超过四个9的可用性(即99.99%),但因运维错误导致实际停机时间延长,实际可用性仅为三个9(即99.9%),凸显了人为因素在系统可靠性中的关键作用。

ABSTRACT

Microsoft TerraServer displays aerial, satellite, and to-pographic images of the earth in a SQL database available via the Internet. It is one of the most popular online at-lases, presenting seventeen terabytes of image data from the United States Geological Survey (USGS). Initially de-ployed in 1998, the system demonstrated the scalability of PC hardware and software - Windows and SQL Server - on a single, mainframe-class processor. In September 2000, the back-end database application was migrated to 4-node active/passive cluster connected to an 18 terabyte Storage Area Network (SAN). The new configuration was designed to achieve 99.99% availability for the back-end application. This paper describes the hardware and software components of the TerraServer Cluster and SAN, and describes our experience in configuring and operating this system for three years. Not surprisingly, the hardware and architecture delivered better than four-9's of availability, but operations mistakes delivered three-9's.

研究动机与目标

  • 设计并部署一个可扩展的、高可用性的存储与数据库系统,用于通过互联网提供大规模地理空间影像服务。
  • 评估使用通用PC硬件和软件(Windows、SQL Server)实现主机级别可靠性与性能的可行性。
  • 记录并总结在三年生产环境SAN集群系统运行过程中遇到的运维挑战与经验教训。
  • 分析由于运维错误导致的理论硬件可用性与实际系统可用性之间的差距。

提出的方法

  • 部署了一个由4个节点组成的主动/备用集群架构,连接至18 TB的存储区域网络(SAN),实现集中化、共享式存储。
  • 采用微软SQL Server和Windows作为核心软件栈,用于管理并提供17 TB的航空与卫星影像数据。
  • 实施高可用性机制,包括故障转移集群和冗余组件,以确保达到99.99%的可用性。
  • 配置系统以支持通过基于SQL的查询实现互联网用户对地理空间数据的并发访问。
  • 在为期三年的运行期间持续监控系统性能与可用性,以评估其可靠性。
  • 开展实施后分析,将硬件韧性与运维事件进行关联分析。

实验结果

研究问题

  • RQ1通用PC硬件与软件能否在大规模、公开可访问的数据库系统中实现主机级别的可靠性?
  • RQ2构建可扩展至TB级数据量、具备高可用性的地理空间影像数据库,其关键架构组件有哪些?
  • RQ3在生产环境的SAN集群中,运维错误如何影响系统可用性?
  • RQ4在真实部署中,理论硬件可用性与实际运行可用性之间存在多大差距?
  • RQ5从三年高可用性、基于PC的SAN集群系统的运维经验中,可以总结出哪些关键教训?

主要发现

  • 硬件与架构设计实现了超过四个9(即99.99%)的可用性,达到了系统的高可用性目标。
  • 运维错误(如配置错误和人为干预失败)导致实际系统可用性下降至约三个9(即99.9%)。
  • 系统成功通过SQL查询向互联网用户提供了来自美国地质调查局(USGS)的17 TB地理空间影像,证明了基于PC的系统具备可扩展性。
  • SAN集群架构实现了高效的数据共享与冗余,支持4个节点集群间的可靠故障切换。
  • 运维经验表明,尽管硬件可靠性高,但人为因素是导致停机的主要原因。
  • 本文结论指出,运维纪律与流程严谨性在实现高可用性方面,与架构设计同等关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。