QUICK REVIEW
[论文解读] Discourse-Based Evaluation of Language Understanding
Damien Sileo, Tim Van-de-Cruys|arXiv (Cornell University)|Jul 19, 2019
Natural Language Processing Techniques被引用 4
一句话总结
本文提出了DiscEval,一个包含11个以语篇为重点的数据集的集合,旨在通过‘意义即用法’的视角评估英语自然语言理解。论文认为,当前的NLI预训练可能无法产生真正通用的表征,并将DiscEval定位为多任务学习系统既可用于评估的基准,也可作为补充训练数据。
ABSTRACT
We introduce DiscEval, a compilation of $11$ evaluation datasets with a focus on discourse, that can be used for evaluation of English Natural Language Understanding when considering meaning as use. We make the case that evaluation with discourse tasks is overlooked and that Natural Language Inference (NLI) pretraining may not lead to the learning really universal representations. DiscEval can also be used as supplementary training data for multi-task learning-based systems, and is publicly available, alongside the code for gathering and preprocessing the datasets.
研究动机与目标
- 解决NLU评估中语篇任务代表性不足的问题。
- 挑战NLI预训练可产生普遍适用表征的假设。
- 为基于语篇的评估和多任务学习提供公开可用、精心整理的数据集合编。
- 支持开发超越标准NLI基准的更稳健、以应用为导向的语言表征。
提出的方法
- 作者将11个现有的语篇聚焦型NLU数据集整合为一个统一的评估基准。
- DiscEval旨在评估语言模型对上下文语境中意义的理解,强调语篇层面的推理能力。
- 该数据集合包含标准化的预处理流程以及数据收集与准备的代码。
- 该框架支持在多任务学习设置中作为补充训练数据的集成。
- 评估聚焦于需要推理、连贯性以及语用理解的任务,超越句子级别的蕴含关系。
- 该基准已公开发布,并附带代码,以确保可复现性和可访问性。
实验结果
研究问题
- RQ1语篇聚焦的评估是否揭示了标准基准所忽略的NLI预训练模型的局限性?
- RQ2语篇感知的数据集能否提升通用语言表征的鲁棒性?
- RQ3当前的NLU模型在多大程度上能超越句子级别的蕴含关系,泛化到语篇层面的意义理解?
- RQ4DiscEval作为多任务学习系统中的补充训练数据有多高效?
- RQ5基于语篇的评估能否推动NLU系统实现更以应用为导向的语言理解?
主要发现
- DiscEval为评估NLU模型的语篇层面理解能力提供了全面的基准。
- 语篇任务的引入揭示了通过NLI预训练学习到的表征中的缺陷。
- DiscEval可作为多任务学习的有效补充训练数据,提升模型的泛化能力。
- 该基准强调了在评估语言理解时‘意义即用法’的重要性。
- 数据集合编与代码的发布,使得基于语篇感知数据的大规模、可复现的评估与训练成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。