Skip to main content
QUICK REVIEW

[论文解读] The Surprising Effectiveness of Test-Time Training for Few-Shot Learning

Ekin Akyürek, Mehul Damani|arXiv (Cornell University)|Nov 11, 2024
Intelligent Tutoring Systems and Adaptive Learning被引用 4
一句话总结

该论文表明,测试时训练(TTT)在ARC基准上显著提升了大语言模型在少样本推理中的表现,使用8B参数模型达到53%的准确率,通过与程序合成模型集成后达到61.875%,与人类平均表现相当。该方法采用任务特定的LoRA适配器、几何数据增强以及基于可逆变换的自一致性推理,从而提升在新型抽象推理任务上的泛化能力。

ABSTRACT

Language models (LMs) have shown impressive performance on tasks within their training distribution, but often struggle with structurally novel tasks even when given a small number of in-context task examples. We investigate the effectiveness of test-time training (TTT) -- temporarily updating model parameters during inference using a loss derived from input data -- as a mechanism for improving LMs' reasoning and few-shot learning capabilities. On the Abstraction and Reasoning Corpus (ARC), performing TTT with in-context examples yields up to $6 imes$ higher accuracy compared to fine-tuned baselines -- reaching $53.0\%$ on the public validation set with an 8B-parameter LM and $61.9\%$ when ensembled with program-synthesis methods, matching average human performance. On BIG-Bench Hard (BBH), TTT on in-context examples surpasses standard few-shot prompting in the $10$-shot setting by $7.3$ percentage points ($50.5\%$ to $57.8\%$). Our findings highlight the limitations of in-context learning for novel tasks and demonstrate the potential of test-time training to enhance language model adaptability.

研究动机与目标

  • 探究测试时训练(TTT)是否能提升大语言模型在新型抽象推理任务上的少样本推理能力。
  • 识别在抽象与推理语料库(ARC)中实现有效TTT以支持少样本泛化的关键设计组件。
  • 通过展示仅使用神经网络与TTT增强的模型即可达到最先进性能,挑战符号程序合成在ARC上为高性能所必需的假设。
  • 评估TTT与现有神经方法或程序合成方法在ARC上的协同效应。
  • 在ARC公开验证集上建立公开可用、纯神经模型的新SOTA。

提出的方法

  • 在推理阶段通过梯度更新对单个输入或少量少样本示例应用测试时训练(TTT),使用基于上下文标签示例的监督损失。
  • 在测试时使用任务特定的LoRA适配器进行参数高效微调,实现对每个输入实例的快速适应。
  • 通过几何变换(如旋转、翻转)生成测试时的增强数据集,以增加归纳偏置并提升泛化能力。
  • 采用基于可逆变换的推理流程,生成多个预测结果,并应用自一致性投票选择最鲁棒的输出。
  • 结合实例级训练与分层自一致性机制,提升在多样化ARC任务上的预测可靠性。
  • 将TTT流程与现有神经模型(如BARC)及程序合成方法结合,实现集成性能。

实验结果

研究问题

  • RQ1在ARC基准上,测试时训练的哪些组件对提升语言模型少样本推理能力最为关键?
  • RQ2仅通过测试时适应,纯神经模型能否在不使用符号程序合成的情况下达到人类水平的ARC表现?
  • RQ3测试时训练如何与上下文学习及数据增强协同作用,以提升在新型抽象推理任务上的泛化能力?
  • RQ4TTT在多大程度上能够弥合神经模型与神经符号方法在ARC上的性能差距?
  • RQ5当结构合理时,测试时计算能否作为复杂推理任务中符号搜索的可行替代方案?

主要发现

  • 采用任务特定LoRA适配器与几何数据增强的测试时训练(TTT)使ARC上的少样本推理准确率相比标准微调模型最高提升6倍。
  • 使用TTT的8B参数语言模型在ARC公开验证集上达到53%的准确率,相比此前公开发布的纯神经方法的SOTA水平提升了近25%。
  • 当与程序合成方法集成后,TTT增强模型达到61.875%的准确率,与数据集上人类的平均表现相当。
  • TTT流程使完全神经模型能够解决此前仅由程序合成模型解决的73.5%的任务,表明系统性推理模式具有强大的迁移能力。
  • 将TTT流程应用于BARC的神经模型后,其准确率从54.375%提升至53%——相比其原始TTT方法实现了35%的相对提升,证明了该方法的鲁棒性与可扩展性。
  • TTT与基于可逆变换的推理及自一致性投票相结合,显著提升了在多样化ARC任务上的预测可靠性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。