Skip to main content
QUICK REVIEW

[论文解读] AutoRC: Improving BERT Based Relation Classification Models via Architecture Search

Wei Zhu, Xipeng Qiu|arXiv (Cornell University)|Sep 22, 2020
Topic Modeling参考文献 26被引用 5
一句话总结

该论文提出 AutoRC,一种神经架构搜索(NAS)框架,通过探索实体跨度识别、池化策略和特征交互,自动发现用于关系分类的最优 BERT 基础架构。采用参数共享和多个 BERT 编码器副本的强化学习方法,AutoRC 在七个基准数据集上实现了最先进性能,展示了任务特定架构的优越性以及对过拟合的鲁棒性。

ABSTRACT

Although BERT based relation classification (RC) models have achieved significant improvements over the traditional deep learning models, it seems that no consensus can be reached on what is the optimal architecture. Firstly, there are multiple alternatives for entity span identification. Second, there are a collection of pooling operations to aggregate the representations of entities and contexts into fixed length vectors. Third, it is difficult to manually decide which feature vectors, including their interactions, are beneficial for classifying the relation types. In this work, we design a comprehensive search space for BERT based RC models and employ neural architecture search (NAS) method to automatically discover the design choices mentioned above. Experiments on seven benchmark RC tasks show that our method is efficient and effective in finding better architectures than the baseline BERT based RC model. Ablation study demonstrates the necessity of our search space design and the effectiveness of our search method.

研究动机与目标

  • 为解决在基于 BERT 的关系分类(RC)架构方面缺乏共识的问题,包括实体跨度识别、池化方法和特征选择。
  • 通过构建涵盖关键架构选择的全面搜索空间,实现 RC 模型设计的自动化。
  • 开发一种高效且有效的基于强化学习的神经架构搜索(NAS)方法,以发现任务特定架构。
  • 通过消融研究和迁移学习实验,验证搜索空间设计的必要性及搜索策略的有效性。

提出的方法

  • 定义了一个全面的搜索空间,涵盖实体跨度识别方法(例如,实体标记或 token 替换)、池化操作(例如,起始池化或平均池化),以及包括实体与上下文表征之间交互在内的特征组合。
  • 基于强化学习的搜索代理生成候选架构,根据验证性能接收奖励,并通过策略梯度方法更新其策略。
  • 通过使用共享的 BERT、池化和分类层权重,对子模型实施参数共享,以加速训练和搜索过程。
  • 在搜索过程中维护多个 BERT 编码器副本,以防止过拟合并提高奖励信号的可靠性。
  • 搜索过程在验证集上进行,最佳性能架构在测试集上通过超参数调优进行微调。
  • 通过将一个任务上学习到的架构应用于其他任务,评估迁移学习效果,以衡量跨领域泛化能力。

实验结果

研究问题

  • RQ1神经架构搜索(NAS)能否有效发现优于人工设计基线的基于 BERT 的关系分类架构?
  • RQ2不同的架构选择(如实体跨度识别、池化策略和特征交互)如何影响 RC 性能?
  • RQ3在搜索过程中维持多个 BERT 编码器副本在多大程度上提升了所发现架构的质量?
  • RQ4所学习的架构在不同领域和任务之间具有多大程度的可迁移性?
  • RQ5搜索空间中的哪些组件对性能提升贡献最大?

主要发现

  • AutoRC 在所有七个基准关系分类任务上均优于标准 BERT 基础 RC 模型,展现出一致且显著的性能提升。
  • 所学习的架构在不同任务间存在显著差异——例如,i2b2 使用实体标记和实体-上下文交互,而 deft2020 使用实体 token 替换和 [CLS] 池化——表明其具有强烈的任务特异性。
  • 消融研究显示,特征交互和多样化的池化操作对性能至关重要,尤其在 i2b2 等复杂任务中表现明显。
  • 在搜索过程中维持多个 BERT 编码器副本可提升泛化能力并获得更高性能,证实其在减少过拟合方面的有效性。
  • 迁移学习结果表明,基于开放领域任务(如 kbp37)训练的模型在医学领域任务(如 i2b2、ddi)上泛化能力差,但来自相似领域的模型(如 i2b2 和 ddi)可良好迁移,凸显领域依赖性。
  • 搜索空间设计被验证为有效:移除特征交互或池化多样性会导致性能显著下降,证实了全面架构探索的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。