Skip to main content
QUICK REVIEW

[论文解读] Automatic Wrappers for Large Scale Web Extraction

Nilesh Dalvi, Ravi Kumar|arXiv (Cornell University)|Mar 12, 2011
Web Data Mining and Analysis参考文献 17被引用 11
一句话总结

本文提出了一种新颖的自动包装器归纳框架,通过使包装器算法对嘈杂的无监督训练数据具有鲁棒性,实现了在网页规模上的高精度网络信息抽取。通过利用从词典和正则表达式廉价生成的噪声标签,该系统消除了对昂贵的站点级监督的需求,实现了完全无监督的训练,并在Yahoo!的生产环境中部署后,实现了大规模网络抽取的最先进精度。

ABSTRACT

We present a generic framework to make wrapper induction algorithms tolerant to noise in the training data. This enables us to learn wrappers in a completely unsupervised manner from automatically and cheaply obtained noisy training data, e.g., using dictionaries and regular expressions. By removing the site-level supervision that wrapper-based techniques require, we are able to perform information extraction at web-scale, with accuracy unattained with existing unsupervised extraction techniques. Our system is used in production at Yahoo! and powers live applications.

研究动机与目标

  • 解决大规模网络数据抽取中包装器归纳的高成本站点级监督问题。
  • 在无需手动标注训练数据的情况下,实现从网页中准确抽取信息。
  • 开发一种能够容忍由字典和正则表达式等启发式方法生成的噪声训练数据的框架。
  • 通过无监督学习技术,在网络规模的信息抽取中实现生产级精度。
  • 弥合无监督抽取方法与实际部署所需精度之间的差距。

提出的方法

  • 设计一种对训练数据中的噪声具有鲁棒性的包装器归纳框架,从而能够使用自动生成的低质量标签。
  • 利用字典和正则表达式等弱监督信号生成大规模、嘈杂的训练样本。
  • 应用一种噪声容忍的学习算法,在包装器训练过程中识别并修正噪声训练数据中的不一致性。
  • 利用概率或判别模型从噪声数据中学习抽取规则,同时最小化误差传播。
  • 将训练好的包装器集成到可扩展的流水线中,以处理数百万个网页。
  • 通过在真实网络数据上的评估以及与现有无监督方法的比较,验证该框架的鲁棒性和准确性。

实验结果

研究问题

  • RQ1包装器归纳能否足够鲁棒,以处理大规模的嘈杂自动生成的训练数据?
  • RQ2在保持高精度的前提下,能在多大程度上消除网络抽取中的站点级监督?
  • RQ3当与噪声容忍学习结合时,基于启发式的方法(如字典、正则表达式)在标注方面有多有效?
  • RQ4完全无监督的包装器归纳系统能否在真实网络数据上实现生产级精度?
  • RQ5与现有无监督或弱监督网络抽取技术相比,所提出框架的性能提升如何?

主要发现

  • 所提出的框架在无需任何站点级监督的情况下实现了高精度抽取,支持完全无监督训练。
  • 该系统成功从通过字典和正则表达式生成的噪声训练数据中学习,显著降低了标注成本。
  • 经Yahoo!真实环境部署验证,该框架在准确率上优于现有无监督抽取技术。
  • 该方法在网页规模数据上表现出良好的可扩展性,适用于生产环境中的大规模信息抽取。
  • 该框架已在Yahoo!生产环境中部署,支持实时应用,证实了其鲁棒性和实际可行性。
  • 该方法通过有效缓解训练数据中的噪声,同时保持抽取精度,优于以往的无监督方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。