Skip to main content
QUICK REVIEW

[论文解读] Parsing Tweets into Universal Dependencies

Yijia Liu, Yi Zhu|arXiv (Cornell University)|Apr 23, 2018
Natural Language Processing Techniques参考文献 35被引用 5
一句话总结

本文介绍了 Tweebank v2,一个包含 55,607 个词符的英文推文语料库,采用通用依存关系(Universal Dependencies)进行标注,并扩展了 UD 指南以处理社交媒体特有的现象。该研究提出一种蒸馏方法,通过一个由 20 个解析器组成的集成模型训练出一个单一、高效的基于转移的解析器,在准确率和速度上均优于强基线模型和当前最先进系统,实现 2.2 的 LAS 提升。

ABSTRACT

We study the problem of analyzing tweets with Universal Dependencies. We extend the UD guidelines to cover special constructions in tweets that affect tokenization, part-of-speech tagging, and labeled dependencies. Using the extended guidelines, we create a new tweet treebank for English (Tweebank v2) that is four times larger than the (unlabeled) Tweebank v1 introduced by Kong et al. (2014). We characterize the disagreements between our annotators and show that it is challenging to deliver consistent annotation due to ambiguity in understanding and explaining tweets. Nonetheless, using the new treebank, we build a pipeline system to parse raw tweets into UD. To overcome annotation noise without sacrificing computational efficiency, we propose a new method to distill an ensemble of 20 transition-based parsers into a single one. Our parser achieves an improvement of 2.2 in LAS over the un-ensembled baseline and outperforms parsers that are state-of-the-art on other treebanks in both accuracy and speed.

研究动机与目标

  • 为应对非正式、用户生成的社交媒体文本中句法解析的挑战,这类文本常违反标准语言规范。
  • 扩展通用依存关系(UD)指南,以适应推文特有的结构,如非标准分词、表情符号和非正式句法。
  • 创建一个大规模、高质量的英文推文语料库(Tweebank v2),尽管社交媒体语言本身存在固有歧义,仍保持标注的一致性。
  • 开发一个端到端的解析系统,能够以高准确率和计算效率将原始推文转化为通用依存关系格式。
  • 通过将 20 个贪婪转移解析器的集成知识蒸馏到一个单一高性能模型中,缓解新语料库中的标注噪声问题。

提出的方法

  • 扩展通用依存关系指南,以涵盖推文特有的现象,包括表情符号、话题标签、URL 和非正式缩写,对分词、词性标注和依存关系标注制定了明确规则。
  • 通过多阶段标注流程,使用多名标注员收集并标注了 Tweebank v2 中的 55,607 个词符,通过分析标注者间分歧来评估一致性挑战。
  • 设计了一个三阶段流水线:双向 LSTM 分词器、基于词簇的词性标注器,以及带有字符级嵌入的栈-LSTM 依存解析器。
  • 提出一种新颖的蒸馏方法,通过最小化混合损失函数(α × 蒸馏损失 + (1−α) × 对数损失)整合 20 个贪婪解析器的集成知识,其中 α 控制集成知识与最优监督之间的平衡。
  • 引入基于探索的训练策略,将 α 设为 1,使蒸馏模型能够从集成模型的探索行为中学习,而非仅依赖最优转移路径。
  • 使用 LAS(带标签依存连接率)评估蒸馏解析器的性能,与基线解析器及由最先进组件构成的最先进流水线进行比较。

实验结果

研究问题

  • RQ1如何扩展通用依存关系指南,以可靠标注非正式、用户生成的推文中的句法结构,特别是包含非标准形式的文本?
  • RQ2标注者间分歧在多大程度上反映了对推文理解的固有歧义?在存在此类歧义的情况下,如何提升标注一致性?
  • RQ3能否通过利用 20 个解析器集成的知识,训练出一个单一、高效的基于转移的解析器,使其在推文解析任务中超越基线模型和最先进系统?
  • RQ4与依赖于标准最优路径的蒸馏相比,从集成模型的探索行为中进行蒸馏(而非从黄金标准最优转移中学习)是否能在贪婪解析设置中带来更好的泛化性能?

主要发现

  • Tweebank v2 包含 55,607 个词符,是 Tweebank v1 的四倍大,是目前公开可用的、以通用依存关系标注的最大规模英文推文语料库。
  • 由于非正式语言本身固有的歧义性,标注者间的一致性仍具挑战性,即使扩展了 UD 指南,分歧依然存在。
  • 所提出的蒸馏方法在基线解析器基础上实现了 2.2 的 LAS 提升,证明了知识蒸馏在处理真实世界噪声标注中的有效性。
  • 从集成模型的探索行为中学习(α=1)相比传统蒸馏带来 1.5 的性能提升,且性能接近完整集成模型(仅差 1.5 LAS 点),同时保持了高推理速度。
  • 完整流水线在依存解析任务中优于由 Stanford CoreNLP、Owoputi 等的标注器和 Dozat 等的解析器组成的最先进流水线(74.0 LAS vs. 71.4 LAS),尤其在依存解析方面表现更优。
  • 黄金标准分词至关重要:若省略该步骤,LAS 下降 4 个百分点,凸显了在推文解析中准确预处理的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。