[论文解读] ChID: A Large-scale Chinese IDiom Dataset for Cloze Test
本论文提出 ChID,一个大规模中文成语数据集,包含来自新闻、小说和散文的 729,000 个完形填空题,其中成语被替换为空白,模型需从候选词中选出正确成语。结果表明,当前最先进模型在人类表现面前显著落后,凸显了由于成语的非组合性与隐喻语义带来的理解挑战。
Cloze-style reading comprehension in Chinese is still limited due to the lack of various corpora. In this paper we propose a large-scale Chinese cloze test dataset ChID, which studies the comprehension of idiom, a unique language phenomenon in Chinese. In this corpus, the idioms in a passage are replaced by blank symbols and the correct answer needs to be chosen from well-designed candidate idioms. We carefully study how the design of candidate idioms and the representation of idioms affect the performance of state-of-the-art models. Results show that the machine accuracy is substantially worse than that of human, indicating a large space for further research.
研究动机与目标
- 为解决缺乏大规模、高质量、聚焦于中文成语的完形测试数据集的问题,而中文成语是一种独特的语言现象。
- 探究候选成语选择策略与成语表征方法如何影响模型在完形阅读理解任务中的表现。
- 建立一个评估机器对中文成语理解能力的基准,尤其关注其非组合性与隐喻性语义。
- 将模型表现与人类表现进行比较,并评估其在域内与域外数据上的泛化能力。
- 探究将成语视为原子语义单元,或通过字符嵌入组合而成,哪种方式在理解任务中表现更优。
提出的方法
- 从新闻、小说和散文中构建了一个大规模数据集(ChID),包含 581,000 个语篇和 729,000 个空白,将成语替换为空白。
- 设计了具有不同难度的候选成语列表,包括同义词、近义词和语义相近的干扰项,以评估模型的区分能力。
- 使用三种最先进模型(LM、AR 和 SAR)在数据集上进行评估,采用不同的成语表征方法:预训练成语嵌入、字符嵌入平均值和 MLP 组合嵌入。
- 使用注意力机制,使模型能够同时关注上下文和空白表征,提升上下文感知的预测能力。
- 应用 Fleiss’ Kappa 评估标注者间一致性,确认标注质量较高(kappa = 0.953)。
- 在域内(Dev、Test)、域外(Out)以及具有挑战性的(Ran、Sim)划分上比较模型表现,以评估泛化能力和难度。
实验结果
研究问题
- RQ1候选成语集合的设计,尤其是近义词和语义相近干扰项的使用,如何影响完形理解任务的难度?
- RQ2不同成语表征方法(如预训练嵌入与字符级组合)在中文成语完形任务中的表现差异有多大?
- RQ3最先进模型在域外数据上的泛化能力如何,特别是在遇到低频成语时?
- RQ4人类标注者与机器模型在理解隐喻性与非组合性中文成语方面存在多大性能差距?
- RQ5在完形任务中,将成语视为原子语义单元是否比通过字符级表征组合而成能获得更好的结果?
主要发现
- 人类在 ChID 上的表现显著优于模型,最小差距为 14.6%(在 Test 上),最大差距达 23.3%(在 Out 上),表明仍有巨大改进空间。
- AR 模型在所有划分上均优于 LM 和 SAR,Test 上达到 72.4%,Out 上达到 62.9%,表明使用空白表征两次的注意力机制能提升性能。
- 与预训练成语嵌入相比,使用字符嵌入平均值或 MLP 组合嵌入会导致性能显著下降(p < 0.01),表明将成语视为原子单位至关重要。
- 模型在域外数据(Out)上的泛化能力较差,性能从 Test 的 72.4% 下降至 62.9%,而人类表现保持稳定(87.1% vs. 86.2%),表明存在明显的泛化差距。
- 完形题的难度与候选成语的相似度正相关,尤其是近义词,这增加了标注难度并挑战模型的区分能力。
- 标注者间一致性(Fleiss’ Kappa = 0.953)较高,证实了数据集的可靠性以及人类在复杂成语选择判断上的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。