Skip to main content
QUICK REVIEW

[论文解读] Initial Experiences Re-Exporting Duplicate and Similarity Computation with an OAI-PMH aggregator

Terry Harrison, Aravind Elango|ArXiv.org|Jan 5, 2004
Data Quality and Management参考文献 3被引用 5
一句话总结

本文提出了一种符合OAI-PMH协议的聚合器,通过向量空间模型(VSM)重新导出元数据记录之间的相似度评分,从而实现对重复记录和相关文档的检测。在3,751条NASA记录上进行了概念验证,8小时内完成700万对相似度计算,平均每对计算耗时0.0036秒,并通过GetRecord响应中的可选<about>元素导出结果。

ABSTRACT

The proliferation of the Open Archive Initiative Protocol for Metadata Harvesting (OAI-PMH) has resulted in the creation of a large number of service providers, all harvesting from either data providers or aggregators. If data were available regarding the similarity of metadata records, service providers could track redundant records across harvests from multiple sources as well as provide additional end-user services. Due to the large number of metadata formats and the diverse mapping strategies employed by data providers, similarity calculation requirements necessitate the use of information retrieval strategies. We describe an OAI-PMH aggregator implementation that uses the optional ``'' container to re-export the results of similarity calculations. Metadata records (3751) were harvested from a NASA data provider and similarities for the records were computed. The results were useful for detecting duplicates, similarities and metadata errors.

研究动机与目标

  • 为解决在OAI-PMH汇集中缺乏检测重复或相似元数据记录的工具问题。
  • 使服务提供方可识别多个数据源中的冗余记录,而无需仅依赖字段匹配。
  • 证明使用信息检索技术(如VSM)在OAI-PMH元数据中进行相似度计算的可行性。
  • 通过在GetRecord响应中使用可选的<about>容器扩展OAI-PMH兼容性,以支持相似度数据。
  • 为基于相似度的服务(如推荐系统和元数据去重)提供可扩展的基础。

提出的方法

  • 系统使用向量空间模型(VSM)基于词频和逆文档频率(idf)计算元数据记录之间的余弦相似度。
  • 对元数据记录进行解析,并将词频存储在tf_metadata和weights_metadata目录下的分层文件结构中。
  • 在运行时计算idf值,并存储词权重,当新增记录时重新计算这些值。
  • 相似度结果存储在678.1 MB的文件中(压缩后为98.7 MB),每条记录的前10个匹配项通过OAI-PMH的GetRecord请求导出。
  • 通过可选的<about>元素在XML响应中嵌入相似度数据,并使用自定义XML模式以确保符合OAI-PMH协议。
  • 系统缓存已汇编的记录,并在后续计算中重用tf_metadata,但因idf值动态变化而重新计算weights_metadata。

实验结果

研究问题

  • RQ1信息检索技术(如VSM)是否能有效识别OAI-PMH数据集中重复和相似的元数据记录?
  • RQ2相似度计算在大型OAI-PMH元数据仓库中能否高效扩展?
  • RQ3能否通过<about>元素原生扩展OAI-PMH以支持相似度元数据,同时不破坏协议兼容性?
  • RQ4在中等规模的元数据集合中,计算成对相似度的计算成本是多少?
  • RQ5重新导出的相似度数据能否改善终端用户服务,如去重和推荐?

主要发现

  • 系统在仅超过7小时的时间内计算了3,751条NASA元数据记录之间的7,033,125对相似度,平均每对计算耗时0.0036秒。
  • 总相似度数据存储在678.1 MB的文件中,压缩后为98.7 MB,证明了相似度元数据的高效存储。
  • 汇编记录、词频和词权重的磁盘使用量分别为15.2 MB、15.2 MB和17.3 MB,表明存储开销可控。
  • 使用当前O(n²)方法计算650万条记录的相似度预计耗时超过2,400年,凸显了可扩展性挑战。
  • 系统成功通过在<about>容器中嵌入相似度结果扩展了OAI-PMH兼容性,使客户端能够消费相似度数据。
  • 每条记录的前10个匹配项成功导出并组织,支持下游应用(如链接创建或元数据去重)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。