Skip to main content
QUICK REVIEW

[论文解读] Word Embeddings for the Construction Domain

Antoine J.‐P. Tixier, Michalis Vazirgiannis|arXiv (Cornell University)|Oct 28, 2016
Topic Modeling参考文献 16被引用 9
一句话总结

本文提出了一种在1100万词的建筑领域专用语料上训练的自定义词嵌入模型,表明领域自适应嵌入在伤害报告分类任务中优于通用的Google新闻向量。在未进行超参数调优的情况下,本地嵌入模型实现了具有竞争力或更优的性能,且通过关键词压缩可实现8倍加速,F1分数仅下降约10%。

ABSTRACT

We introduce word vectors for the construction domain. Our vectors were obtained by running word2vec on an 11M-word corpus that we created from scratch by leveraging freely-accessible online sources of construction-related text. We first explore the embedding space and show that our vectors capture meaningful construction-specific concepts. We then evaluate the performance of our vectors against that of ones trained on a 100B-word corpus (Google News) within the framework of an injury report classification task. Without any parameter tuning, our embeddings give competitive results, and outperform the Google News vectors in many cases. Using a keyword-based compression of the reports also leads to a significant speed-up with only a limited loss in performance. We release our corpus and the data set we created for the classification task as publicly available, in the hope that they will be used by future studies for benchmarking and building on our work.

研究动机与目标

  • 开发并发布一个大规模、公开可用的建筑领域专用文本语料(1100万词),以促进建筑领域自然语言处理研究。
  • 评估领域特定词嵌入在建筑自然语言处理任务中是否优于通用嵌入。
  • 提出一种新颖的、公开共享的5845份伤害报告数据集,包含11个标注变量,用于分类和关键词提取的基准测试。
  • 评估基于关键词的压缩在计算效率与分类准确率之间的权衡。
  • 证明在建筑文本挖掘中使用词嵌入的可行性与优势,特别是在安全风险建模和伤害预测方面。

提出的方法

  • 从公开获取的在线资源(包括建筑手册、安全报告和技术文档)构建了1100万词的建筑领域语料。
  • 使用默认超参数在自定义语料上训练word2vec跳字模型,生成密集的低维词向量(m=300)。
  • 在包含11个因变量的新伤害报告分类数据集上,采用4折交叉验证设置评估嵌入性能。
  • 通过F1分数和计算时间,将自定义嵌入与Google新闻词向量及词袋基线模型进行比较。
  • 通过CoreRank算法为每份报告选择排名最高的30%词语,实现基于关键词的压缩,减少输入大小并加速推理。
  • 在所有分类任务中,测量相对于完整文本输入的性能下降与加速效果。

实验结果

研究问题

  • RQ1在领域特定的建筑语料上训练的词嵌入能否捕捉到与建筑文本相关的有意义的语义和句法关系?
  • RQ2自定义建筑领域嵌入在多个与伤害相关的类别中,与通用嵌入(如Google新闻)相比,其在伤害报告分类中的表现如何?
  • RQ3基于关键词的伤害报告压缩在多大程度上降低了计算成本,同时保持了分类性能?
  • RQ4在专门的建筑自然语言处理任务中,使用本地领域特定嵌入是否相比全局预训练嵌入具有性能优势?
  • RQ5领域特定嵌入与压缩输入表示的结合,是否能够实现在可接受准确率损失下的更快、可扩展的伤害报告分类?

主要发现

  • 自定义的1100万词建筑语料成功生成了编码建筑领域特定概念(如建筑工种、安全术语和设备)的词嵌入。
  • 在未进行任何超参数调优的情况下,自定义嵌入在11项伤害分类任务中的5项上优于Google新闻词向量,尤其在“安全违规”和“设备”类别中优势显著。
  • 基于关键词的压缩将8核机器上4折交叉验证的平均计算时间从9.7K秒降至1.1K秒(实现8倍加速)。
  • 压缩导致的整体F1分数下降幅度约为10%,该结果在所有样本上测量。
  • Google新闻嵌入整体表现优异,但自定义嵌入在一半的分类任务中表现更优,表明领域知识具有实际益处。
  • 对建筑语料进行微调或预训练可进一步提升性能,当前结果表明在小规模、专业领域中本地嵌入具有明显优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。