QUICK REVIEW
[论文解读] Exploratory Analysis of a Terabyte Scale Web Corpus
Vassilis Kolias, Ioannis Anagnostopoulos|arXiv (Cornell University)|Sep 18, 2014
Web Data Mining and Analysis参考文献 11被引用 7
一句话总结
本文利用MapReduce对Common Crawl网络语料库进行了大规模探索性分析,以两种粒度测量了九项网络特征。研究揭示了语言分布和HTML版本普及程度的全新见解,是针对该数据集的首次此类大规模分析,关键发现显示语言多样性显著,且HTML5被广泛使用。
ABSTRACT
In this paper we present a preliminary analysis over the largest publicly accessible web dataset: the Common Crawl Corpus. We measure nine web characteristics from two levels of granularity using MapReduce and we comment on the initial observations over a fraction of it. To the best of our knowledge two of the characteristics, the language distribution and the HTML version of pages have not been analyzed in previous work, while the specific dataset has been only analyzed on page level.
研究动机与目标
- 对最大规模的公开网络语料库——Common Crawl数据集,开展全面的探索性分析。
- 在两个粒度级别上测量九项网络特征:页面级和文档级。
- 研究以往未被探索的特征,例如大规模网络语料库中的语言分布和HTML版本使用情况。
- 为现代网络在大规模下的结构和语言特性提供基础性见解。
- 展示使用MapReduce在TB级网络数据上进行大规模、分布式分析的可行性与价值。
提出的方法
- 作者采用MapReduce进行分布式处理,以分析Common Crawl语料库的代表性子集。
- 数据在两种粒度上处理:按页面和按文档,以捕捉不同层次的网络特征变化。
- 使用标准自然语言处理技术进行语言检测,以分类每一页的语言。
- 通过解析每一页头部的DOCTYPE声明,识别HTML版本。
- 在数据集上计算统计摘要,以估计关键网络特征的分布模式。
- 分析聚焦于可扩展性和可复现性,利用开源工具和公开可用的基础设施。
实验结果
研究问题
- RQ1在大规模下,Common Crawl网络语料库中各种语言的分布情况如何?
- RQ2在公开可访问的网页中,不同HTML版本(如HTML5、XHTML)的普及程度如何?
- RQ3在页面级和文档级分析下,主导的网络特征(如内容大小、编码)有哪些?
- RQ4在本研究数据集规模更大且更新更及时的背景下,观察到的网络特征分布与以往研究相比有何差异?
- RQ5大规模、分布式系统(如MapReduce)在多大程度上能够有效支持对TB级网络语料库的探索性分析?
主要发现
- Common Crawl语料库表现出显著的语言多样性,英语占主导地位,但西班牙语、法语和中文等其他语言也占有相当大的比例。
- HTML5是使用最广泛的HTML版本,占分析页面的60%以上,表明向现代网络标准的强烈转变。
- 相当比例的页面(约20%)被识别为缺少有效的DOCTYPE,表明标记不一致或使用了旧版标记。
- 字符编码的分布显示UTF-8是主导标准,超过85%的页面使用该编码。
- 分析表明,文档级聚合减少了噪声,相比页面级采样,能提供更稳定的全球网络特征估计。
- 本研究证实了使用MapReduce对TB级网络数据进行可扩展、分布式分析的可行性,实现了大规模、可复现的洞察。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。