Skip to main content
QUICK REVIEW

[论文解读] HUBERT Untangles BERT to Improve Transfer across NLP Tasks

Mehrad Moradshahi, Hamid Palangi|arXiv (Cornell University)|Oct 25, 2019
Topic Modeling参考文献 37被引用 16
一句话总结

HUBERT 通过使用张量积表示(TPRs)将 BERT 的表征解耦为内容(填充项)和结构角色两部分,提出了一种改进 NLP 中迁移学习的方法。通过学习将语义内容与句法角色分离,HUBERT 在跨任务迁移中实现了显著提升,尤其在 HANS 等具有挑战性的 NLP 基准测试中表现优异,在 GLUE 任务上比 BERT 最高提升 12.28%,在非蕴含案例中提升 5.7%。

ABSTRACT

We introduce HUBERT which combines the structured-representational power of Tensor-Product Representations (TPRs) and BERT, a pre-trained bidirectional Transformer language model. We show that there is shared structure between different NLP datasets that HUBERT, but not BERT, is able to learn and leverage. We validate the effectiveness of our model on the GLUE benchmark and HANS dataset. Our experiment results show that untangling data-specific semantics from general language structure is key for better transfer among NLP tasks.

研究动机与目标

  • 解决尽管 BERT 在单个任务上表现强劲,但其表征在多样化 NLP 任务间迁移能力有限的问题。
  • 探究是否可通过将 BERT 表征中的语义内容(填充项)与结构角色解耦,获得更具通用性的语言知识。
  • 评估编码在角色中的结构知识是否能有效迁移到不同 NLP 任务中。
  • 通过减少对词法重叠等表面启发式规则的依赖,提升在 HANS 等诊断性 NLP 基准测试中的鲁棒性。
  • 证明基于 TPR 的解耦可增强知识迁移,使角色与填充项表征可在不同任务间共享。

提出的方法

  • HUBERT 在 BERT 最后一层的 token 表征之上引入 TPR 层,将每个 token 的表征分解为填充项嵌入与角色嵌入的张量积。
  • 模型通过在下游 NLP 任务上进行端到端训练,学习将 BERT 的纠缠表征分解为独立的填充项与角色组件。
  • TPR 机制通过张量积运算将填充项与角色向量绑定,以分布式、连续的向量空间方式保留结构关系。
  • 在 MNLI 上预训练后,HUBERT 将学习到的角色与填充项表征迁移至其他任务(如 QNLI、QQP、RTE、SST 和 SNLI),仅在新任务上进行微调。
  • 在 HANS 评估中,模型仅将从 MNLI 学习到的角色与填充项表征迁移至 HANS 诊断数据集,未在 HANS 数据上重新训练。
  • 该方法使模型在保持蕴含案例性能的同时,显著提升了对违反句法启发式规则的非蕴含案例的泛化能力。

实验结果

研究问题

  • RQ1通过 TPR 将 BERT 表征解耦为填充项与角色组件,是否能提升在多样化 NLP 任务间的知识迁移能力?
  • RQ2当迁移到新任务时,编码在角色中的结构知识是否比 BERT 的纠缠表征具有更好的泛化能力?
  • RQ3基于 TPR 的表征在多大程度上减少了对词法重叠等虚假语言启发式规则的依赖,特别是在自然语言蕴含任务中?
  • RQ4HUBERT 在诊断基准测试(如 HANS)上的表现与 BERT 相比如何,特别是在非蕴含案例上?
  • RQ5仅将一个任务(如 MNLI)中学到的角色与填充项表征迁移到另一个任务(如 SNLI)是否能提升在具有挑战性的、分布外样本上的性能?

主要发现

  • 在微调后,HUBERT 在下游 GLUE 任务(QNLI、QQP、RTE、SST、SNLI)上的性能提升幅度为 0.60% 至 12.28%,而 BERT 的提升幅度为 -0.33% 至 2.53%。
  • 在 HANS 诊断数据集上,HUBERT 在非蕴含类别的平均性能提升了 5.7%,表明其对表面启发式规则的依赖性降低。
  • 在 SNLI 上微调后,HUBERT 在词法非蕴含案例上的性能提升了 61.62%(6,162 个样本),表明角色特定的词嵌入具有强大的迁移能力。
  • 在子序列与成分非蕴含案例上的性能分别提升了 1.44% 和 5.4%,表明其对句法违规具有更强的鲁棒性。
  • 虽然 BERT 在 SNLI 上微调后,其在蕴含案例上的性能略有提升,但在非蕴含案例上的性能显著下降,表明其对新知识的整合能力较差。
  • HUBERT 在保持蕴含案例高性能的同时,大幅提升了非蕴含案例的性能,证明了其具备有效的知识迁移能力并减少了启发式偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。