QUICK REVIEW
[论文解读] TTTTTackling WinoGrande Schemas
Sheng-Chieh Lin, Jheng-Hong Yang|arXiv (Cornell University)|Mar 18, 2020
Topic Modeling参考文献 9被引用 5
一句话总结
本文提出一种基于T5-3B模型的序列到序列方法,通过将每个多项选择题分解为两个文本到文本的推理实例(每个实例包含一个假设和前提),并利用蕴含/矛盾概率选择正确答案,以应对WinoGrande常识推理挑战。该方法在官方排行榜上取得了0.7673的SOTA AUC,较之前模型高出五个百分点以上。
ABSTRACT
We applied the T5 sequence-to-sequence model to tackle the AI2 WinoGrande Challenge by decomposing each example into two input text strings, each containing a hypothesis, and using the probabilities assigned to the "entailment" token as a score of the hypothesis. Our first (and only) submission to the official leaderboard yielded 0.7673 AUC on March 13, 2020, which is the best known result at this time and beats the previous state of the art by over five points.
研究动机与目标
- 通过序列到序列的预训练方法提升在WinoGrande常识推理基准上的表现。
- 通过引入基于logits的概率投票机制,解决多项选择常识任务中模型输出模糊或非对比性的问题。
- 探究T5的生成能力是否能在偏见鲁棒的常识推理任务中超越仅编码器的模型(如RoBERTa)。
- 评估目标token选择(例如,'entailment/contradiction'与'true/false')对模型性能的影响。
- 判断WinoGrande上的最先进性能是否反映了真实的推理进步,还是残余数据集偏差的体现。
提出的方法
- 将每个WinoGrande样本分解为两个输入输出对,其中空白处被每个答案选项替换,模型预测生成的句子对是否蕴含或矛盾。
- 使用包含'premise:'和'hypothesis:'前缀的模板,将模型在T5-3B上进行微调,采用文本到文本格式。
- 在推理阶段,两个选项独立评分,模型对'entailment'和'contradiction'的预测概率通过预定义目标token上的softmax进行比较。
- 采用投票策略,在输出不一致或非对比性时,选择'entailment'或'contradiction'概率更高的选项。
- 在Google Colab的TPU v2上训练模型,批量大小为16,基础微调学习率为$2 \cdot 10^{-4}$,每5000步保存一次检查点。
- 最终模型基于开发集表现选择,推理时使用贪婪解码。
实验结果
研究问题
- RQ1序列到序列模型(如T5)是否能在WinoGrande基准上超越仅编码器的模型(如RoBERTa),该基准旨在减少数据集偏差?
- RQ2目标token的选择(如'entailment/contradiction'与'true/false')是否显著影响模型性能?
- RQ3基于logits的概率投票策略在模型输出模糊的预测情况下,能在多大程度上提升鲁棒性?
- RQ4WinoGrande上的高性能是否反映了真实的常识推理能力,还是对残余统计偏差的利用?
- RQ5T5的生成预训练能力是否能带来优于纯自回归语言建模的常识推理表现?
主要发现
- 该方法在官方WinoGrande测试集上取得了0.7673的AUC,为提交时已知的最佳结果。
- 基于logits的投票策略显著提升了性能,尤其在模型输出非对比性或模糊的情况下。
- 在更大规模训练数据(最高至XL)上微调带来了持续的性能提升,最大数据划分在开发集上的AUC达到0.854。
- 使用'true/false'作为目标token并未提升性能,尽管在零样本设置下表现具有竞争力。
- 该模型优于基于RoBERTa的先前SOTA方法,表明T5的生成能力可能在常识推理任务中具有优势。
- 即使在零样本设置下,logits技巧仍使性能明显高于随机水平,表明该方法对缺乏微调具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。