[论文解读] HyperGrid: Efficient Multi-Task Transformers with Grid-wise Decomposable Hyper Projections
HyperGrid 提出了一种基于超网络的分区域网格化可分解投影层,用于在 Transformer 模型中实现高效的多任务学习,使单一 T5 模型在 GLUE 和 SuperGLUE 基准测试中达到与独立微调的最先进模型相当的性能。通过采用局部-全局超网络组合方式学习任务特定的区域化权重投影,该方法在保持 16 项任务上具有竞争力的准确率的同时,实现了 16 倍的参数量减少。
Achieving state-of-the-art performance on natural language understanding tasks typically relies on fine-tuning a fresh model for every task. Consequently, this approach leads to a higher overall parameter cost, along with higher technical maintenance for serving multiple models. Learning a single multi-task model that is able to do well for all the tasks has been a challenging and yet attractive proposition. In this paper, we propose extsc{HyperGrid}, a new approach for highly effective multi-task learning. The proposed approach is based on a decomposable hypernetwork that learns grid-wise projections that help to specialize regions in weight matrices for different tasks. In order to construct the proposed hypernetwork, our method learns the interactions and composition between a global (task-agnostic) state and a local task-specific state. We apply our proposed extsc{HyperGrid} on the current state-of-the-art T5 model, demonstrating strong performance across the GLUE and SuperGLUE benchmarks when using only a single multi-task model. Our method helps bridge the gap between fine-tuning and multi-task learning approaches.
研究动机与目标
- 降低为每个自然语言理解任务单独微调模型所带来的高参数量与维护成本。
- 弥合单任务微调与 Transformer 中多任务联合训练之间的性能差距。
- 使单一模型能够在无需任务特定微调技巧的情况下,在多样化自然语言理解任务中保持竞争力。
- 探索通过超网络实现结构化、实例特定的参数自适应,以提升多任务泛化能力。
提出的方法
- 引入基于网格的投影机制,将前馈层权重划分为空间区域,实现对每个输入的区域特定参数自适应。
- 采用双超网络架构,包含一个局部任务特定头和一个全局任务无关状态嵌入,用于组合生成参数。
- 使用可分解的超投影机制,建模局部状态与全局状态之间的丰富成对交互,提升表达能力并实现更好的因子分解。
- 将 HyperGrid 模块应用于 T5 模型,在多任务微调过程中用任务条件化的自适应投影替换标准前馈层。
- 在所有 GLUE 和 SuperGLUE 任务上同时训练单一多任务模型,避免使用任务特定的超参数和集成方法。
- 采用 $32 \times 128$ 网格进行参数化,并使用局部-全局(LG)配置以平衡表达能力与效率。
实验结果
研究问题
- RQ1单一多任务 Transformer 模型是否能在多样化的自然语言理解基准上实现与独立微调模型相媲美的性能?
- RQ2如何设计超网络结构,实现在不增加模型规模的前提下高效的任务特定自适应?
- RQ3与传统的行级重加权相比,基于网格的、区域特定的参数投影是否能提升多任务泛化能力?
- RQ4可分解的局部-全局超网络组合是否在多任务学习中优于标准超网络?
主要发现
- 3B 参数的 HyperGrid 模型在 SuperGLUE 上达到 87.7 分,仅比最先进水平低 1.2%,但参数量减少了 16 倍。
- 11B 参数的 HyperGrid 模型在 GLUE 上的表现与 176B 的 T5(11B)模型相当,分别达到 89.4 和 89.7 分。
- 在 SuperGLUE 上,3B 模型得分 84.7,与依赖任务特定微调技巧的 RoBERTa 集成模型表现相当。
- HyperGrid 模型优于强基线模型如 BERT++ 和 RoBERTa,后者依赖集成和任务特定策略,而 HyperGrid 仅使用单一模型。
- 与为全部 16 个 GLUE 和 SuperGLUE 任务分别训练独立模型相比,该方法将总参数量成本降低了 16 倍。
- 局部-全局超网络组合实现了有效的任务特定自适应,且未出现灾难性遗忘或性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。