[论文解读] Bridging the Gap between Reality and Ideality of Entity Matching: A Revisiting and Benchmark Re-Construction
本文指出,现有实体匹配(EM)基准存在偏差,原因在于三个有缺陷的假设:受限实体、平衡标签和单模态数据。为解决此问题,作者通过引入开放实体、不平衡标签和多模态记录,重构了基准,揭示了当前最先进EM模型在真实场景下的性能显著下降,且视觉特征在开放、不平衡环境中带来显著提升。
Entity matching (EM) is the most critical step for entity resolution (ER). While current deep learningbased methods achieve very impressive performance on standard EM benchmarks, their realworld application performance is much frustrating. In this paper, we highlight that such the gap between reality and ideality stems from the unreasonable benchmark construction process, which is inconsistent with the nature of entity matching and therefore leads to biased evaluations of current EM approaches. To this end, we build a new EM corpus and re-construct EM benchmarks to challenge critical assumptions implicit in the previous benchmark construction process by step-wisely changing the restricted entities, balanced labels, and single-modal records in previous benchmarks into open entities, imbalanced labels, and multimodal records in an open environment. Experimental results demonstrate that the assumptions made in the previous benchmark construction process are not coincidental with the open environment, which conceal the main challenges of the task and therefore significantly overestimate the current progress of entity matching. The constructed benchmarks and code are publicly released
研究动机与目标
- 揭示当前EM基准评估与真实世界应用性能之间的根本性脱节。
- 识别现有基准构建中的三个有缺陷的假设:受限实体、平衡标签和单模态数据。
- 重构反映现实世界实体匹配中开放性、不平衡性和多模态特性的EM基准。
- 在真实条件下评估最先进EM模型,以揭示性能下降和隐藏挑战。
- 证明多模态数据——尤其是视觉特征——在开放环境中提升EM鲁棒性的关键作用。
提出的方法
- 通过系统性地放松三个假设(受限实体、平衡标签和单模态记录)来重构EM基准。
- 通过确保测试集包含训练数据中未出现的未见聚类和记录,引入开放实体。
- 通过构建匹配对与不匹配对比例高达100:1的数据集,模拟现实世界中的数据不平衡。
- 使用图像和文本数据引入多模态记录,并采用视觉Transformer进行视觉特征提取。
- 设计门控融合机制,以结合文本和视觉匹配表征,实现多模态EM。
- 在原始基准和新构建的基准上训练并评估最先进EM模型,以比较性能下降情况。
实验结果
研究问题
- RQ1由于不切实际的假设,当前EM基准在多大程度上高估了模型性能?
- RQ2当模型在开放的、未见的聚类和记录上进行评估时,性能下降程度如何?
- RQ3数据不平衡(例如100:1的不匹配对与匹配对比例)对EM模型泛化能力有何影响?
- RQ4在开放和不平衡设置下,视觉特征在提升EM性能方面的有效性如何?
- RQ5多模态融合在真实实体匹配场景中在多大程度上增强了模型鲁棒性?
主要发现
- 在新构建的开放环境基准上评估时,最先进EM模型的性能出现显著下降——在CFM上F1分数下降超过7点,在OM上下降超过11点。
- 在不平衡基准中,视觉特征的引入使某些类别的F1分数提升超过40%,证明其在真实场景中的关键作用。
- 由于平衡标签假设的存在,传统基准中视觉特征的性能增益被低估,其真实影响被掩盖。
- 在标准基准上训练的模型无法泛化到未见聚类和记录,凸显了受限实体假设的局限性。
- 基准性能与真实世界应用之间的差距主要源于基准构建的缺陷,而非模型本身的局限。
- 采用门控融合的多模态模型在所有真实基准设置下均优于单模态基线,尤其在开放和不平衡场景中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。