[论文解读] BERT-Based Arabic Social Media Author Profiling
该论文提出基于BERT的阿拉伯语社交媒体作者画像模型,聚焦于通过微调多语言BERT和自建数据增强技术进行年龄、方言和性别预测。通过在不同数据条件下训练的多个BERT模型进行多数投票,实现了最佳性能——年龄预测准确率为54.72%,方言识别准确率为93.75%,性别预测准确率为81.67%,联合准确率为40.97%。结果表明,在低资源阿拉伯语自然语言处理任务中,数据增强与集成学习策略具有显著有效性。
We report our models for detecting age, language variety, and gender from social media data in the context of the Arabic author profiling and deception detection shared task (APDA). We build simple models based on pre-trained bidirectional encoders from transformers (BERT). We first fine-tune the pre-trained BERT model on each of the three datasets with shared task released data. Then we augment shared task data with in-house data for gender and dialect, showing the utility of augmenting training data. Our best models on the shared task test data are acquired with a majority voting of various BERT models trained under different data conditions. We acquire 54.72% accuracy for age, 93.75% for dialect, 81.67% for gender, and 40.97% joint accuracy across the three tasks.
研究动机与目标
- 开发针对社交媒体阿拉伯语作者画像任务的鲁棒BERT模型,重点聚焦于年龄、方言和性别预测。
- 评估自建标注数据增强对方言和性别分类任务模型性能的影响。
- 探究在不同数据条件下训练的多个BERT模型通过多数投票实现集成学习的有效性。
- 应对阿拉伯语作者画像中低资源问题,特别是针对代表性不足的方言和性别类别。
- 通过提交具备更强泛化能力的数据与模型集成模型,为APDA共享任务做出贡献。
提出的方法
- 针对年龄、方言和性别三个分类任务,分别在共享任务数据上微调多语言BERT-Base cased模型。
- 引入自建标注数据集——性别任务1,100名用户,方言任务每类20,000条推文,与官方训练数据结合形成扩展数据集,用于数据增强。
- 在原始共享任务数据和扩展数据(BERT_EXT)上分别训练BERT模型,以提升泛化能力并减少过拟合。
- 采用两阶段流程:首先在推文级别进行预测,然后通过用户级别多数投票聚合结果。
- 最终测试预测采用三种不同模型配置(首次提交、使用DEV数据的第二次提交、用户级别BERT模型)的多数投票策略。
- 应用标准训练协议:序列长度50个标记,批量大小32,初始初始值学习率2e-5,训练15个周期,并在验证集上启用早停。
实验结果
研究问题
- RQ1BERT微调在阿拉伯语作者画像任务中效果如何,特别是在年龄、方言和性别预测方面?
- RQ2自建数据增强在低资源阿拉伯语方言和性别分类任务中能多大程度提升模型性能?
- RQ3在不同数据条件下训练的多个BERT模型通过多数投票实现的集成学习是否优于单个模型?
- RQ4将验证集数据(DEV)整合到训练中,对模型在官方测试集上的泛化能力有何影响?
- RQ5在APDA共享任务中,多任务作者画像系统在年龄、方言和性别预测上的联合性能如何?
主要发现
- 通过三种不同BERT配置多数投票获得的最佳模型在年龄分类任务中达到54.72%的准确率。
- 方言识别任务中,最终提交结果达到93.75%的准确率,显著优于初始BERT模型(93.33%)和BERT_EXT模型(95.56%)在测试集上的表现。
- 性别分类任务在最终提交中达到81.67%的准确率,超过初始BERT模型(77.08%)和BERT_EXT模型(84.00%)在测试集上的表现。
- 三项任务的联合预测准确率达到40.97%,表明在共享任务使用的多标签评估指标下表现优异。
- 使用自建数据集进行数据增强显著提升了方言和性别任务的性能,BERT_EXT模型相较基线BERT模型表现出持续提升。
- 多数投票策略效果显著,相较于单个模型提交,其在所有三项任务中均保持或提升了性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。