[论文解读] On the Paradox of Learning to Reason from Data
本文研究了 BERT 是否能在受限的问题空间中,从自然语言数据中学习到逻辑推理能力。尽管在分布内样本上达到了接近完美的准确率,BERT 仍无法泛化到同一问题空间的其他分布,因为它学习的是推理问题中固有的统计模式,而非正确的推理函数。研究揭示,移除这些统计特征在计算上不可行,暴露了从数据中学习推理的根本困境。
Logical reasoning is needed in a wide range of NLP tasks. Can a BERT model be trained end-to-end to solve logical reasoning problems presented in natural language? We attempt to answer this question in a confined problem space where there exists a set of parameters that perfectly simulates logical reasoning. We make observations that seem to contradict each other: BERT attains near-perfect accuracy on in-distribution test examples while failing to generalize to other data distributions over the exact same problem space. Our study provides an explanation for this paradox: instead of learning to emulate the correct reasoning function, BERT has in fact learned statistical features that inherently exist in logical reasoning problems. We also show that it is infeasible to jointly remove statistical features from data, illustrating the difficulty of learning to reason in general. Our result naturally extends to other neural models and unveils the fundamental difference between learning to reason and learning to achieve high performance on NLP benchmarks using statistical features.
研究动机与目标
- 研究神经网络模型(如 BERT)是否能从受限的、封闭的问题空间中的自然语言数据中学习逻辑推理能力。
- 解决逻辑推理任务中高分布内准确率与差分布外泛化能力之间的悖论。
- 识别模型是学习了正确的推理函数,还是依赖于推理问题中固有的统计伪影。
- 检验从训练数据中移除统计特征以实现真正推理泛化的可行性。
- 揭示由于逻辑推理样本中不可避免的统计偏差,从数据中学习推理的根本挑战。
提出的方法
- 研究采用一个名为 SimpleLogic 的受限问题空间,其包含具有固定规则和事实的自然语言逻辑推理问题。
- 在覆盖整个问题空间的训练分布上微调 BERT,以评估分布内性能及在其他分布上的泛化能力。
- 分析与标签相关的统计特征,如规则数量(#rule)、事实数量(#fact)和分支因子(b)。
- 量化在特定特征值下标签概率的不平衡程度,以评估特征对标签的预测强度。
- 采用基于采样的方法估算在同时移除多个统计特征时,为平衡条件概率所需的数据量。
- 分析表明,同时移除多个统计特征的计算成本随特征数量的增加呈指数级增长。
实验结果
研究问题
- RQ1BERT 是否能在受限问题空间中实现高逻辑推理性能,同时在不同数据分布间实现泛化?
- RQ2为何 BERT 在相同问题空间的其他分布上表现不佳,尽管其在分布内测试中接近完美?
- RQ3逻辑推理问题中固有的统计特征(如 #rule 或 #fact)在多大程度上影响模型预测,而非真正的推理过程?
- RQ4从训练数据中同时移除多个统计特征以实现真正推理泛化,在计算上是否可行?
- RQ5在 NLP 基准中,学习推理与利用统计模式之间存在何种根本性差异?
主要发现
- BERT 在 SimpleLogic 问题空间的分布内测试样本上实现了接近完美的准确率(接近 100%),即使存在分布偏移。
- 即使正确的推理函数保持不变,模型在相同问题空间的其他数据分布上仍无法泛化。
- 统计特征如 #rule、#fact 和分支因子与标签表现出强烈相关性,例如 Pr(label=1 | #rule=58) = 0.991,使其成为强预测信号。
- 随着更多统计特征被组合,条件概率 Pr(label=1 | X) 的不平衡性加剧,需呈指数级增长的样本量才能平衡。
- 当依次添加 #fact、branching_factor 和 #rule 时,为平衡 Pr(label=1 | f=15, b∈[2.65,2.75]) 所需的最小样本数从 5.5× 增至 20.0× 再增至 55.6×。
- 由于为平衡标签分布所需采样量随特征数量呈指数增长,从训练数据中同时移除多个统计特征在计算上不可行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。