[论文解读] GCDT: A Chinese RST Treebank for Multigenre and Multilingual Discourse Parsing
本文提出了GCDT,这是目前规模最大的中文RST语料库,涵盖五种文体,总词元数超过60K,其关系体系与英文RST语料库保持一致。通过利用多语言嵌入进行跨语言训练以及自动EDU翻译,该研究在单语和多语言RST解析任务中均取得了最先进性能。微调在较小的中文数据集上提升了结果,而多语言训练则实现了整体最佳性能。
A lack of large-scale human-annotated data has hampered the hierarchical discourse parsing of Chinese. In this paper, we present GCDT, the largest hierarchical discourse treebank for Mandarin Chinese in the framework of Rhetorical Structure Theory (RST). GCDT covers over 60K tokens across five genres of freely available text, using the same relation inventory as contemporary RST treebanks for English. We also report on this dataset's parsing experiments, including state-of-the-art (SOTA) scores for Chinese RST parsing and RST parsing on the English GUM dataset, using cross-lingual training in Chinese and English with multilingual embeddings.
研究动机与目标
- 为解决中文普通话缺乏大规模、人工标注的RST语料库的问题,该问题限制了层次化语篇解析的发展。
- 建立一个高质量、多文体的中文RST语料库,使其与现有英文RST标准保持一致,以实现跨语言兼容性。
- 使用共享标注框架,在中文和英文数据集上评估单语和多语言语篇解析的性能。
- 探究多语言训练、微调以及自动翻译在提升低资源语言与高资源语言解析性能方面的有效性。
- 分析不同文体在语篇解析中的性能差异,以理解模型在不同类型文本上的泛化能力。
提出的方法
- 作者构建了GCDT,一个包含60K词元、涵盖五种文体的中文普通话RST语料库,其RST标注规范和关系体系与英文RST语料库保持一致。
- 他们使用中文RoBERTa嵌入在GCDT上进行单语训练,在中文数据集上取得了最先进结果。
- 通过将GCDT与英文GUM语料库结合,使用XLM-RoBERTa-base作为多语言嵌入模型,开展了多语言训练。
- 在与英文数据联合训练后,对较小的中文GCDT数据集进行微调,提升了中文性能,但对英文性能造成损害。
- 他们使用自动EDU级翻译(通过Google Translate实现)扩充训练数据,从而能够使用性能更优的单语嵌入模型。
- 采用标准RST解析指标评估性能,包括关系层和跨度层的F1分数,在多种测试场景和文体下进行评估。

实验结果
研究问题
- RQ1能否构建一个大规模、多文体的中文普通话RST语料库,其标注规范和关系体系与英文RST语料库保持一致?
- RQ2与单语训练相比,联合使用中文和英文多语言数据进行训练是否能提升两种语言的语篇解析性能?
- RQ3在较小的中文数据集(GCDT)上进行微调是否优于仅联合训练?其性能是否能泛化到更大的英文数据集?
- RQ4对英文语篇单元进行自动EDU级翻译是否能提升中文的解析性能,尤其是在结合单语嵌入模型时?
- RQ5在中文语篇解析中,不同文体的解析性能与人工标注者一致性如何变化?
主要发现
- 在单语训练中,单语RoBERTa嵌入优于多语言嵌入,其中hfl/chinese-roberta-wwm-ext在GCDT上达到51.76的F_Rel分数。
- 在GCDT与GUM-12(12种文体)联合训练中实现了最高整体性能,GCDT上的F_Rel达到52.61,超过单语训练结果。
- 在GCDT上进行微调使性能从50.45提升至52.61,但损害了在更大英文GUM数据集上的表现。
- 自动EDU级翻译与单语嵌入结合在四组测试场景中的三组中取得了最佳性能,证明其在低资源语言解析中的有效性。
- 按文体分析发现,说明文(whow)的解析最准确,但其与人工标注上限的差距最大,表明该文体存在特定挑战。
- 性能在不同文体间差异显著,学术文章比说明文更难解析,表明文体特征对解析难度有显著影响。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。