[论文解读] Simplified DOM Trees for Transferable Attribute Extraction from the Web
本文提出 SimpDOM,一种无需视觉特征的可迁移方法,通过简化后的 DOM 树从网页中提取属性。通过利用 DOM 树中的结构上下文和节点关系,SimpDOM 实现了最先进性能,在先前方法的基础上将 F1 分数提升 1.44%,在跨垂直领域的少样本设置下,额外提升 1.37%。
There has been a steady need to precisely extract structured knowledge from the web (i.e. HTML documents). Given a web page, extracting a structured object along with various attributes of interest (e.g. price, publisher, author, and genre for a book) can facilitate a variety of downstream applications such as large-scale knowledge base construction, e-commerce product search, and personalized recommendation. Considering each web page is rendered from an HTML DOM tree, existing approaches formulate the problem as a DOM tree node tagging task. However, they either rely on computationally expensive visual feature engineering or are incapable of modeling the relationship among the tree nodes. In this paper, we propose a novel transferable method, Simplified DOM Trees for Attribute Extraction (SimpDOM), to tackle the problem by efficiently retrieving useful context for each node by leveraging the tree structure. We study two challenging experimental settings: (i) intra-vertical few-shot extraction, and (ii) cross-vertical fewshot extraction with out-of-domain knowledge, to evaluate our approach. Extensive experiments on the SWDE public dataset show that SimpDOM outperforms the state-of-the-art (SOTA) method by 1.44% on the F1 score. We also find that utilizing knowledge from a different vertical (cross-vertical extraction) is surprisingly useful and helps beat the SOTA by a further 1.37%.
研究动机与目标
- 解决在多样化、未见过的网站上以极少人工标注提取结构化属性的挑战。
- 克服现有方法依赖计算成本高昂的视觉特征或无法建模 DOM 树中节点关系的局限。
- 开发一种单阶段、可迁移的模型,仅用少量标注样本即可在不同网页垂直领域(如书籍、电影、职位)间泛化。
- 探索跨垂直少样本学习的有效性,即一个领域中的知识能否提升另一领域的提取性能。
- 为网页属性提取提供一种可扩展、高效的替代方案,避免基于渲染或两阶段模型的复杂性。
提出的方法
- 通过剪枝非必要节点并仅保留对属性提取具有语义相关性的结构,构建简化后的 DOM 树。
- 通过聚合 DOM 树中邻近节点的上下文特征,生成丰富的节点表示,重点关注语义线索(如 'by')或属性值的共现模式。
- 使用树结构感知的表示建模节点级上下文,编码邻近性和层次关系,无需视觉渲染。
- 训练单阶段分类模型,基于节点的上下文表示预测其属性类型(如作者、价格)。
- 通过在新网站或领域的少样本示例上微调,实现迁移学习,利用相关垂直领域的知识。
- 采用简化的邻域定义,以捕捉网站无关信号(如 'by' 前置作者)和垂直领域无关模式(如分组的属性簇)。
实验结果
研究问题
- RQ1基于 DOM 树的方法是否能在不依赖视觉特征的前提下,实现跨不同网页垂直领域的强可迁移性?
- RQ2在仅使用同一领域中少量标注网站的情况下,领域内少样本属性提取的效率如何?
- RQ3来自其他垂直领域(即域外知识)的知识在多大程度上能提升少样本属性提取的性能?
- RQ4DOM 树中哪些结构和语义线索对识别属性值最具信息量?
- RQ5与最先进方法相比,所提出方法在 F1 分数和泛化能力方面表现如何?
主要发现
- 在 SWDE 数据集上,SimpDOM 在领域内少样本提取设置下,F1 分数相比最先进方法提升 1.44%。
- 当利用其他垂直领域的域外知识时,SimpDOM 在最先进方法基础上进一步提升 1.37% 的性能,证明其具备强大的可迁移性。
- 当使用最具帮助的域外垂直领域作为知识源且 k=3 时,SimpDOM 在所有垂直领域上实现了平均 93% 的 F1 分数。
- 跨垂直知识迁移的对称热力图显示,某些垂直对(如书籍与 NBA 球员、职位与电影)之间存在相互受益现象,表明存在共享的结构模式。
- 该方法通过简化树邻域有效捕捉了语义线索,如 'by' 前置作者姓名,以及分组的属性值(如 ISBN、出版社)。
- SimpDOM 通过消除渲染需求、内存密集型图像存储和复杂预处理流程,优于基于视觉特征和两阶段的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。