[论文解读] Studying Strategically: Learning to Mask for Closed-book QA
本文提出一种可学习的掩码策略,通过在预训练文本中识别与任务相关的跨度,以提升闭卷问答性能。通过利用下游问答任务的监督信号,训练策略模型预测可能的答案跨度,并在中间预训练阶段应用该策略,该方法将更多相关知识压缩进BART模型中,在TriviaQA数据集上达到24.71%的精确匹配率,优于启发式显著跨度掩码(23.62%)和随机掩码(22.93%)。
Closed-book question-answering (QA) is a challenging task that requires a model to directly answer questions without access to external knowledge. It has been shown that directly fine-tuning pre-trained language models with (question, answer) examples yields surprisingly competitive performance, which is further improved upon through adding an intermediate pre-training stage between general pre-training and fine-tuning. Prior work used a heuristic during this intermediate stage, whereby named entities and dates are masked, and the model is trained to recover these tokens. In this paper, we aim to learn the optimal masking strategy for the intermediate pre-training stage. We first train our masking policy to extract spans that are likely to be tested, using supervision from the downstream task itself, then deploy the learned policy during intermediate pre-training. Thus, our policy packs task-relevant knowledge into the parameters of a language model. Our approach is particularly effective on TriviaQA, outperforming strong heuristics when used to pre-train BART.
研究动机与目标
- 通过在中间预训练期间战略性地选择要掩码的跨度,以提升闭卷问答性能。
- 学习一种能够基于下游问答任务监督信号识别可能被测试的跨度的掩码策略。
- 超越基于启发式的掩码方法(如命名实体和日期),转向数据驱动、任务感知的掩码策略。
- 评估在某一问答数据集上学习的策略是否可迁移,以提升其他问答数据集的性能。
- 研究如何通过智能掩码将关于可测试内容的元知识编码进语言模型参数中。
提出的方法
- 使用来自问答数据集的(上下文,问题,答案)三元组训练掩码策略,模型预测答案跨度的起始和结束位置。
- 该策略通过交叉熵损失最大化正确答案跨度的恢复概率进行训练。
- 在通用语料库(如维基百科)的中间预训练阶段应用该策略,动态掩码与任务相关的跨度。
- 在完成此任务感知的预训练阶段后,将掩码语言模型(BART)在下游闭卷问答任务上进行微调。
- 掩码策略与语言模型端到端联合训练,利用下游问答任务的监督信号指导跨度选择。
- 该方法将掩码视为一种填空选择任务,类似于问题生成,使模型学习哪些内容可能被测试。
实验结果
研究问题
- RQ1与启发式掩码相比,能否通过学习的掩码策略识别出可能的答案跨度,从而提升闭卷问答性能?
- RQ2在某一问答数据集上训练的掩码策略是否可在其他问答数据集上实现性能提升,即具备迁移能力?
- RQ3在中间预训练中,学习的掩码策略相较于随机掩码或启发式掩码策略,性能表现如何?
- RQ4学习的掩码策略捕捉了何种类型的元知识?其与学生备考行为有何关联?
- RQ5该掩码策略能否有效实现将任务相关知识‘打包’进语言模型参数?
主要发现
- 在TriviaQA开发集上,学习的掩码策略达到24.71%的精确匹配率,优于显著跨度掩码(23.62%)和随机掩码(22.93%)。
- 在BART-large模型上部署最佳策略时,性能提升保持一致,表明该方法不仅适用于基础模型,也具备可扩展性。
- 该策略展现出正向迁移能力:在TriviaQA上训练的模型可提升其他问答数据集的性能,表明跨度选择中存在共享的元知识。
- 该策略能有效掩码上下文段落中的重要事实性跨度,如机构名称和日期,与人类对可测试内容的预期一致。
- 由于独立预测起始/结束位置,存在局限性,可能导致错误的跨度边界(如将两个独立实体合并为一个跨度)。
- 结果表明,在中间预训练阶段采用策略性掩码可能比模型规模扩展更具影响力,因为显著跨度掩码带来的性能提升超过将T5模型从3B参数扩展到11B参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。