[论文解读] Delaying Interaction Layers in Transformer-based Encoders for Efficient Open Domain Question Answering
本文在 BERT 和 ALBERT 模型中提出了延迟交互层(DIL),通过将自注意力计算推迟到较后层,以提升开放域问答(ODQA)的效率,使 FLOPs 最多减少 85%,在 CPU/GPU 上实现最多 10 倍的加速,同时在 OpenSQuAD 等多段落 ODQA 基准测试中保持或提升性能。
Open Domain Question Answering (ODQA) on a large-scale corpus of documents (e.g. Wikipedia) is a key challenge in computer science. Although transformer-based language models such as Bert have shown on SQuAD the ability to surpass humans for extracting answers in small passages of text, they suffer from their high complexity when faced to a much larger search space. The most common way to tackle this problem is to add a preliminary Information Retrieval step to heavily filter the corpus and only keep the relevant passages. In this paper, we propose a more direct and complementary solution which consists in applying a generic change in the architecture of transformer-based models to delay the attention between subparts of the input and allow a more efficient management of computations. The resulting variants are competitive with the original models on the extractive task and allow, on the ODQA setting, a significant speedup and even a performance improvement in many cases.
研究动机与目标
- 解决基于 Transformer 的模型在开放域问答(ODQA)中计算成本过高的问题,因为在实时处理数百万篇文档段落时不可行。
- 克服在 Wikipedia 等大规模语料库中应用抽取式 QA 模型时推理速度缓慢的瓶颈。
- 探索在不牺牲答案准确率的前提下减少计算量的架构改进,特别是在多段落设置下。
- 开发一种通用且与预训练模型兼容的方法,实现在标准基准测试上保持性能的同时实现更快的推理速度。
- 研究延迟注意力交互是否能提升对无关或多个段落的泛化能力,减少对单一相关文档的过拟合。
提出的方法
- 引入延迟交互层(DIL)机制,仅在 Transformer 编码器的最后 k 个层中计算自注意力,而前 (12-k) 个层在无跨段落注意力的情况下处理输入。
- 将 DIL 机制应用于 BERT 和 ALBERT 架构,创建 DilBERT 和 DilALBERT 变体,保留预训练权重,并仅在下游 QA 任务上进行微调。
- 使用标准检索器(Lucene 与 BM25)检索前 p 篇相关文档,然后应用 DilBERT/DilALBERT 读者从这些段落中提取答案。
- 仅将注意力限制在最后 k 个层(例如 k=2),以显著降低推理过程中的 FLOPs 和内存使用量,尤其适用于 CPU 或低资源环境。
- 保持与原始模型相同的模型架构和头结构,确保与现有预训练权重和微调流程的兼容性。
- 在 SQuAD v1.1 上训练 DIL 模型,并在 OpenSQuAD 上进行微调,使用标准交叉熵损失进行跨度预测,同时监控单段落和多段落设置下的性能。
实验结果
研究问题
- RQ1在 Transformer 编码器中将自注意力计算推迟到较后层,是否能显著减少开放域 QA 中的推理时间,同时不降低答案准确率?
- RQ2DIL 机制是否能提升对多个或无关段落的泛化能力,减少对单一相关文档的过拟合?
- RQ3与原始模型相比,DIL 机制在标准抽取式 QA 基准测试(如 SQuAD v1.1)上的性能保留程度如何?
- RQ4在多段落 ODQA 设置下,特别是 OpenSQuAD 上,DIL 变体与标准 BERT/ALBERT 的性能相比如何?
- RQ5DIL 机制是否可以通用化地应用于其他基于 Transformer 的模型,而无需重新训练或修改架构?
主要发现
- DilBERT 和 DilALBERT 模型在处理 ODQA 任务时,CPU 和 GPU 上的推理时间最多实现 10 倍加速,当 k=10 时,FLOPs 最多减少 85%(即 6 倍)。
- 在 SQuAD v1.1 基准测试中,DilBERT 和 DilALBERT 表现具有竞争力,单段落 QA 的精确匹配(EM)和 F1 值仅略有下降,表明在标准任务上性能退化极小。
- 在 OpenSQuAD 基准测试中,DilBERT 和 DilALBERT 在从多个相关段落选择答案时优于其基础模型,表现出更强的泛化能力。
- DIL 机制减少了对单一相关段落的过拟合,表现为在多个段落上预测结果更一致,且对无关上下文的敏感性降低。
- 作者报告称,Lucene + BERT 基线在 OpenSQuAD 上因工程优化而获得改进结果,但 DIL 变体仍实现了最先进的性能,且推理速度显著更快。
- 该方法具有通用性,与现有预训练模型兼容,可在无需重新训练或访问大规模预训练数据的情况下实现部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。