[论文解读] Critical Thinking for Language Models
本文提出一个演绎有效论证的合成语料库,用于为语言模型构建‘批判性思维课程’,通过在 GPT-2 上训练核心逻辑模式(如假言推理和逆否命题)实现。该模型展现出强大的迁移学习能力,能泛化至复杂论证类型,并在 GLUE 和 SNLI 基准测试中实现最高达 15 个百分点的零样本性能提升。
This paper takes a first step towards a critical thinking curriculum for neural auto-regressive language models. We introduce a synthetic corpus of deductively valid arguments, and generate artificial argumentative texts to train and evaluate GPT-2. Significant transfer learning effects can be observed: Training a model on three simple core schemes allows it to accurately complete conclusions of different, and more complex types of arguments, too. The language models generalize the core argument schemes in a correct way. Moreover, we obtain consistent and promising results for NLU benchmarks. In particular, pre-training on the argument schemes raises zero-shot accuracy on the GLUE diagnostics by up to 15 percentage points. The findings suggest that intermediary pre-training on texts that exemplify basic reasoning abilities (such as typically covered in critical thinking textbooks) might help language models to acquire a broad range of reasoning skills. The synthetic argumentative texts presented in this paper are a promising starting point for building such a "critical thinking curriculum for language models."
研究动机与目标
- 探究在高质量、合成的演绎推理示例上训练语言模型,是否能提升其通用推理能力。
- 构建一个有效三段论论证的合成语料库,作为语言模型进行批判性思维训练的基础资源。
- 评估在论证模式上进行中间阶段预训练,是否能在下游自然语言理解任务中产生迁移学习效应。
- 探究语言模型是否能将所学的逻辑模式泛化至训练分布之外。
- 评估此类课程对多样化推理基准的影响,包括 GLUE、SNLI 和 LogiQA。
提出的方法
- 使用自然语言模板构建一个涵盖核心逻辑模式(如广义假言推理、逆否命题和链式推理)的演绎有效论证合成语料库。
- 使用因果语言建模范式在该语料库上训练 GPT-2,超参数设置为 8 块 GPU、2 个周期,批量大小为 2。
- 评估模型完成未见过论证类型的结论的能力,包括复杂形式如两难推理和德摩根定律。
- 在标准自然语言理解基准(包括 GLUE 和 SNLI)上测试零样本性能,以衡量迁移学习效应。
- 使用人工提示和受控模板,评估模型在训练领域之外的泛化能力,并确保输入格式的一致性。
- 通过可配置的模板架构,为未来扩展提供支持,例如命题推理模式、模态推理和谬误检测。
实验结果
研究问题
- RQ1在精心筛选的演绎有效论证语料库上训练语言模型,是否能实现对多样化论证类型的推理泛化能力提升?
- RQ2在核心逻辑模式上进行中间阶段预训练,对标准自然语言理解基准(如 GLUE 和 SNLI)的零样本性能提升有多大程度的迁移效应?
- RQ3模型泛化所学论证模式的能力是否依赖于其底层语言建模能力?
- RQ4为何在论证语料库上进行训练无法提升在更复杂的语义任务(如论证推理理解与 LogiQA)上的表现?
- RQ5一个基于规则的合成论证语料库能否作为语言模型更广泛‘批判性思维课程’的可行基础?
主要发现
- 在合成演绎有效论证语料库上训练 GPT-2 可产生显著的迁移学习效应,使模型能够准确完成训练中未见过的复杂论证类型的结论。
- 模型能正确将核心逻辑模式(如假言推理、逆否命题和链式推理)泛化至新颖且更复杂的论证形式,表明其已内化推理模式。
- 在 GLUE 基准测试中,经过论证语料库预训练后,零样本性能最高提升 15 个百分点,表明下游推理能力显著增强。
- 模型在 SNLI 基准测试中也表现出一致的性能提升,证实其自然语言蕴含能力得到增强。
- 在对语义要求更高的论证推理理解与 LogiQA 任务中,性能未见改善,表明其在处理更高级别的语用或语境推理方面仍存在局限。
- 结果支持如下假设:在基础推理技能示例上进行中间阶段预训练,可显著提升模型在广泛任务中的推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。