[论文解读] BertGCN: Transductive Text Classification by Combining GCN and BERT
BertGCN 同时训练 BERT 编码器和 GCN 在异构词-文档图上执行传导文本分类,在多个数据集上达到最先进的结果。
In this work, we propose BertGCN, a model that combines large scale pretraining and transductive learning for text classification. BertGCN constructs a heterogeneous graph over the dataset and represents documents as nodes using BERT representations. By jointly training the BERT and GCN modules within BertGCN, the proposed model is able to leverage the advantages of both worlds: large-scale pretraining which takes the advantage of the massive amount of raw data and transductive learning which jointly learns representations for both training data and unlabeled test data by propagating label influence through graph convolution. Experiments show that BertGCN achieves SOTA performances on a wide range of text classification datasets. Code is available at https://github.com/ZeroRin/BertGCN.
研究动机与目标
- 推动将大规模预训练与传导学习相结合用于文本分类。
- 提出一个异构的词-文档图,使用 BERT 初始化的文档嵌入作为 GCN 输入。
- 联合训练 BERT 和 GCN 模块,并可选地对它们的预测进行插值。
- 通过记忆库方法解决大图上 GCN 训练的低效问题。
提出的方法
- 构建一个异构的词-文档图,其中文档节点使用 BERT 嵌入作为初始特征。
- 使用两层 GCN 在归一化的邻接矩阵上传播信息。
- 将 BertGCN 的预测与直接的 BERT 预测进行插值,以形成最终输出。
- 在带标签文档的交叉熵损失下进行训练,同时更新 BERT 和 GCN 参数。
- 引入一个记忆库来存储所有文档嵌入,以在训练过程中实现批量大小与图规模解耦。
实验结果
研究问题
- RQ1能否在基于传导的 GCN 文本分类中利用大规模预训练的收益?
- RQ2联合训练 BERT 和 GCN 是否比单独使用任一组件时性能更好?
- RQ3对 BERT 与 BertGCN 的预测进行插值是否比仅使用 BertGCN 获得更好的结果?
- RQ4如何在大图上训练 BertGCN 时实现内存效率?
主要发现
- BertGCN 在多个数据集上达到与 TextGCN、SGC、BERT 和 RoBERTa 基线相比的最先进性能。
- 基于 RoBERTa 的 BertGCN 变体在所有测试数据集上达到最高分,在更长的文档如 20NG 和 Ohsumed 上尤其显著提升。
- 在 20NG 上,RoBERTaGCN 的最佳性能出现在 lambda≈0.7 时,表明 GCN 和 BERT 组件之间的平衡。
- 记忆库通过将批量大小与图中的总节点数解耦,实现高效训练。
- BERT 模块的小学习率以及在训练前的微调在记忆库设置中提高稳定性和准确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。