Skip to main content
QUICK REVIEW

[论文解读] Joint Structured Models for Extraction from Overlapping Sources

Rahul Gupta, Sunita Sarawagi|arXiv (Cornell University)|May 1, 2010
Topic Modeling参考文献 17被引用 11
一句话总结

本文提出一种基于协议的学习框架,用于在重叠文本源上联合训练多个结构化模型,通过在团簇和位置上分解协议目标,提升对噪声的鲁棒性与训练效率。实验表明,在58个真实世界数据集上,团簇级与节点级协议模型在准确率与速度上均优于融合或多视角方法。

ABSTRACT

We consider the problem of jointly training structured models for extraction from sources whose instances enjoy partial overlap. This has important applications like user-driven ad-hoc information extraction on the web. Such applications present new challenges in terms of the number of sources and their arbitrary pattern of overlap not seen by earlier collective training schemes applied on two sources. We present an agreement-based learning framework and alternatives within it to trade-off tractability, robustness to noise, and extent of agreement. We provide a principled scheme to discover low-noise agreement sets in unlabeled data across the sources. Through extensive experiments over 58 real datasets, we establish that our method of additively rewarding agreement over maximal segments of text provides the best trade-offs, and also scores over alternatives such as collective inference, staged training, and multi-view learning.

研究动机与目标

  • 解决在有限标注数据与任意重叠模式下,对多个重叠文本源联合训练结构化模型的挑战。
  • 开发一种可扩展且鲁棒的集体训练框架,利用多达20个源之间的部分重叠。
  • 通过识别未标注重叠内容中的高质量、低噪声团簇,降低协议集中的噪声。
  • 比较并评估不同协议目标(单个、分组、全局)在准确率、鲁棒性与计算可处理性之间的权衡。
  • 确立在团簇与位置上分解协议相比融合或多视角学习方法具有更优性能。

提出的方法

  • 提出一种基于协议的学习框架,通过在重叠内容片段(团簇)上最大化协议似然,联合训练多个结构化模型。
  • 为每个源定义基于特征向量与参数的概率模型,其联合似然结合了在共享实例上的跨源协议。
  • 引入基于团簇的协议集计算策略,将由任意一元组重复引起的噪声从17.3%降低至5.6%(位置级别),显著提升协议质量。
  • 采用分解协议目标,将每个团簇或单个位置视为独立的协议单元,从而增强对噪声团簇的鲁棒性。
  • 使用梯度上升法高效优化似然目标,相较于较慢的EM方法更具优势。
  • 评估多种协议策略:团簇级、节点级(按位置)与融合的全局图近似,同时进行噪声与优化质量的消融实验。

实验结果

研究问题

  • RQ1如何在有限标注数据与任意重叠模式下,对多个重叠文本源联合训练结构化模型?
  • RQ2在多源学习中,为最大化准确率与鲁棒性,最优的协议单位(如单个、连续段、全局图)是什么?
  • RQ3协议集中的噪声如何影响模型性能?是否可在无真实标签的情况下有效降低噪声?
  • RQ4与融合或多视角学习相比,分解协议目标在准确率、速度与噪声鲁棒性方面表现如何?
  • RQ5优化方法(基于梯度 vs. EM)对训练效率与最终模型性能有何影响?

主要发现

  • 团簇与节点级协议模型在58个真实数据集上达到最高F1准确率,优于集体推理、分阶段训练与多视角学习。
  • 在团簇与位置上分解协议的目标比融合图近似更鲁棒,后者对错误团簇敏感。
  • 所提出的团簇生成方法将位置级噪声从17.3%(朴素一元组方法)降低至5.6%,准确率接近无噪声团簇水平。
  • 节点级协议将团簇分解为单个位置,通过在优化中忽略错误位置,在高噪声环境下优于团簇级协议。
  • 基于梯度的似然目标训练速度比EM方法快四倍以上,且准确率仅下降0.4%。
  • 不精确的梯度计算是复杂融合方法性能不佳的主要原因,消融实验(有/无噪声团簇)已证实此结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。