[论文解读] Providing Authentic Long-term Archival Access to Complex Relational Data
本文提出 SIARD,一种软件无关的长期归档保存复杂关系型数据库的方法,通过使用 SQL 和 XML 将数据、模式和元数据提取为标准化、平台无关的打包格式。该方法可实现无厂商依赖的归档访问,并可在任何符合标准的关系型数据库管理系统(RDBMS)中未来重建,确保长期的完整性、真实性和可用性。
We discuss long-term preservation of and access to relational databases. The focus is on national archives and science data archives which have to ingest and integrate data from a broad spectrum of vendor-specific relational database management systems (RDBMS). Furthermore, we present our solution SIARD which analyzes and extracts data and data logic from almost any RDBMS. It enables, to a reasonable level of authenticity, complete detachment of databases from their vendor-specific environment. The user can add archival descriptive metadata according to a customizable schema. A SIARD database archive integrates data, data logic, technical metadata, and archival descriptive information in one archival information package, independent of any specific software and hardware, based upon plain text files and the standardized languages SQL and XML. For usage purposes, a SIARD archive can be reloaded into any current or future RDBMS which supports standard SQL. In addition, SIARD contains a client that enables 'on demand' reload of archives into a target RDBMS, and multi-user remote access for querying and browsing the data together with its technical and descriptive metadata in one graphical user interface.
研究动机与目标
- 解决国家档案馆和科学数据存储库中日益增长的复杂、厂商特定的关系型数据库长期保存挑战。
- 克服当前归档实践中依赖人工、易出错且非标准化的关系型数据导入方式的局限性。
- 开发一种将关系型数据与专有 RDBMS 环境解耦的解决方案,同时保留数据逻辑与完整性。
- 通过独立于特定软件或硬件的标准化、开放格式,确保关系型数据库长期可访问性和真实性。
- 支持将数据、元数据和技术信息整合为一个自包含的归档包,以支持未来的重用与可审计性。
提出的方法
- 使用数据库特定的“模式”和一个通用模式,从几乎所有 RDBMS 中提取数据、模式和元数据,以实现更广泛的兼容性。
- 使用 SQL:1999 和 XML 将数据库结构与数据表示为标准化、人类与机器可读的格式。
- 使用纯文本文件将所有归档组件——数据、模式、元数据和技术信息——存储在一个自包含的包中。
- 使用 XML 模式(XSD)验证并确保基于 XML 的元数据和模式文件的一致性。
- 实现 SQL 解析器与验证器,检查 SQL DDL 语句的语法和结构依赖关系,确保正确性与可移植性。
- 提供客户端应用程序,支持在任何符合标准的 RDBMS 中按需重新加载 SIARD 归档,并通过图形界面支持多用户远程访问。
实验结果
研究问题
- RQ1如何实现对来自多种厂商特定 RDBMS 的关系型数据库的高真实度与长期可访问性归档?
- RQ2何种技术方法可实现关系型数据与专有数据库系统完全解耦,同时保留数据逻辑与完整性?
- RQ3是否可以创建一个标准化的、开放格式的归档包,将数据、模式和描述性元数据整合在一起,以确保未来的可用性?
- RQ4在多大程度上可以利用标准 SQL 和 XML 实现复杂关系型数据库的软件无关归档保存?
- RQ5归档系统如何实现大规模、复杂关系型数据库的自动导入与保存,而无需人工干预?
主要发现
- SIARD 能够成功地将来自多种 RDBMS 的数据、模式和元数据提取并打包为单一、标准化、平台无关的归档信息包。
- 使用标准 SQL:1999 和 XML 可确保归档内容在不同系统之间以及随时间推移的长期可访问性与可验证性。
- 该解决方案支持将归档文件按需重新加载到任何兼容的 RDBMS 中,确保未来可用性与数据重建能力。
- 采用模块化架构与“专家模式”,可在不修改核心代码的前提下,动态扩展以支持新的 RDBMS 产品。
- 通过 XML 模式和自定义 SQL 解析器对 SIARD 文件进行验证,可确保数据一致性与结构正确性,降低出错风险。
- 该方法显著减少了归档导入过程中的手动工作量,并支持大规模、自动化的复杂关系型数据库处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。