[论文解读] Investigating Biases in Textual Entailment Datasets
本文研究了 SNLI 和 MultiNLI 文本蕴涵数据集中的标签偏差,表明模型仅使用假设即可在 SNLI 上达到 64% 的准确率,显示出强烈的表面相关性。作者提出一种基于贪心法的二元语法修剪方法,以减少假设-标签相关性,通过消除数据中的虚假模式,提升模型的鲁棒性。
The ability to understand logical relationships between sentences is an important task in language understanding. To aid in progress for this task, researchers have collected datasets for machine learning and evaluation of current systems. However, like in the crowdsourced Visual Question Answering (VQA) task, some biases in the data inevitably occur. In our experiments, we find that performing classification on just the hypotheses on the SNLI dataset yields an accuracy of 64%. We analyze the bias extent in the SNLI and the MultiNLI dataset, discuss its implication, and propose a simple method to reduce the biases in the datasets.
研究动机与目标
- 调查 SNLI 和 MultiNLI 数据集是否包含与 VQA 数据集中发现的类似偏差,即模型利用表面相关性进行预测。
- 评估当前最先进的 RTE 模型是否过度依赖这些偏差,而非真正的文本蕴涵推理。
- 提出一种简单、基于启发式的方法,通过修剪假设中高度可预测的二元语法,减少训练数据中的偏差。
- 证明移除此类偏差后,假设-only 分类性能下降,表明模型对虚假相关性的依赖减少。
- 倡导重新思考数据划分与数据集构建方式,确保测试集与训练集在分布上不同,以提升基准测试的有效性。
提出的方法
- 在 SNLI 和 MultiNLI 上训练一个仅使用假设的分类器(基于 RNN),以测量仅使用假设时的性能,通过显著高于随机水平的准确率揭示偏差。
- 对训练集和测试集中的假设进行二元语法频率分析,识别与标签分布强烈相关的 n-gram。
- 对训练集应用贪心修剪策略,移除最具预测性的二元语法对应的样本,以降低假设-标签相关性。
- 使用 ESIM 模型在完整 RTE 任务上评估修剪后的数据集,并与原始数据集和随机修剪基线进行比较。
- 评估修剪对假设-only 分类和前提-假设分类性能的影响,以衡量偏差减少的效果。
- 该方法强调通过修改数据分布而非调整模型架构来减少对偏差的利用。
实验结果
研究问题
- RQ1SNLI 和 MultiNLI 数据集在多大程度上包含允许模型仅通过假设预测标签的偏差?
- RQ2这些偏差在多大程度上影响了当前最先进的 RTE 模型的评估,特别是导致性能被高估?
- RQ3基于二元语法频率的简单、数据驱动的修剪方法是否能在不损害整体 RTE 性能的前提下减少假设-标签相关性?
- RQ4减少假设层面的偏差是否能带来更鲁棒的模型,使其更依赖前提-假设推理而非表面模式?
- RQ5训练集与测试集在分布上的相似性对 NLI 基准评估有效性的潜在影响是什么?
主要发现
- 仅使用假设的分类器在 SNLI 测试集上达到 64% 的准确率,显著高于随机水平,表明假设与标签之间存在强烈的虚假相关性。
- 在 MultiNLI 上,仅使用假设的分类器在不匹配的开发集上达到 51% 的准确率,表明其表面偏差少于 SNLI。
- 所提出的贪心修剪方法将 SNLI 上的假设-only 准确率从 64% 降低至 56%,表明成功缓解了虚假相关性。
- 尽管测试集性能下降了 3%,但修剪后的数据集表现出更低的假设-only 准确率,表明对边缘特征的利用减少。
- 随机修剪基线表现出相似的 RTE 性能但更低的假设-only 准确率,证实该效果源于移除预测性特征,而非数据集大小的改变。
- 结果表明,当前最先进的模型得分可能因过度依赖表面模式而非真正的蕴涵推理而被高估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。