[论文解读] Data Augmentation for Mental Health Classification on Social Media
本文提出使用EDA、条件性BERT(AugBERT)和回译(AugBT)进行数据增强,以解决社交媒体心理健康分类中的数据稀疏性问题。结果表明,AugBERT在多个分类器和数据集上显著提升了F1分数和精确率,且在Dreaddit和SDCNL数据集上均具有统计学意义(p < 0.05),证实数据增强是低资源心理健康NLP任务的可行解决方案。
The mental disorder of online users is determined using social media posts. The major challenge in this domain is to avail the ethical clearance for using the user generated text on social media platforms. Academic re searchers identified the problem of insufficient and unlabeled data for mental health classification. To handle this issue, we have studied the effect of data augmentation techniques on domain specific user generated text for mental health classification. Among the existing well established data augmentation techniques, we have identified Easy Data Augmentation (EDA), conditional BERT, and Back Translation (BT) as the potential techniques for generating additional text to improve the performance of classifiers. Further, three different classifiers Random Forest (RF), Support Vector Machine (SVM) and Logistic Regression (LR) are employed for analyzing the impact of data augmentation on two publicly available social media datasets. The experiments mental results show significant improvements in classifiers performance when trained on the augmented data.
研究动机与目标
- 解决由于伦理和标注限制导致的社交媒体心理健康分类中的数据稀疏性问题。
- 探究数据增强技术在特定领域心理健康文本分类中的可行性和影响。
- 评估基于规则的方法和基于预训练模型的增强方法在公开社交媒体数据集上的有效性。
- 确定增强数据是否能在多种模型(RF、SVM、LR)和嵌入方法(D2V、TF-IDF)下提升分类器性能。
- 评估增强技术带来的数据多样性及性能提升的统计显著性。
提出的方法
- 应用三种数据增强技术:简易数据增强(EDA)、条件性BERT(AugBERT)和回译(AugBT),以生成合成的心理健康相关文本。
- 使用基于规则的EDA,通过随机插入、删除、交换和替换操作,在保持标签语义的同时提升文本多样性。
- 利用微调后的BERT模型(条件性BERT)生成语境相关且标签保持不变的增强句子。
- 通过将原文翻译为目标语言后再译回源语言的方式实现回译,以保留语义含义。
- 在原始数据和增强数据上使用D2Vec(D2V)和TF-IDF嵌入方法,训练并评估三种分类器——随机森林(RF)、支持向量机(SVM)和逻辑回归(LR)。
- 使用BLEU分数(n=2)衡量数据多样性,比较原始文本与增强文本之间的n-gram重叠度。
实验结果
研究问题
- RQ1数据增强技术能否有效缓解社交媒体心理健康分类中的数据稀疏性问题?
- RQ2不同增强方法(EDA、AugBERT、AugBT)在提升心理健康文本分类器性能方面表现如何比较?
- RQ3在使用增强数据时,哪种分类器与嵌入方法的组合能取得最佳性能?
- RQ4数据增强在多大程度上提升了精确率和F1分数,尤其是在低资源心理健康NLP场景下?
- RQ5在多个数据集和分类器上,数据增强带来的性能提升是否具有统计学显著性?
主要发现
- AugBERT在F1分数提升方面表现最佳,在使用逻辑回归时,Dreaddit数据集上的F1分数相比原始数据提升了5.5%。
- 通过t检验确认了统计显著性:在Dreaddit数据集上,AugBERT的p值为0.00033(在5%显著性水平下显著),在SDCNL数据集上为0.09241(在10%显著性水平下显著)。
- AugBERT生成的数据多样性高于EDA和BT,BLEU分数分别为0.82(Dreaddit)和0.97(SDCNL),表明n-gram变化更多。
- 使用D2Vec嵌入的逻辑回归在所有增强技术中表现出最一致的性能提升,尤其在使用AugBERT时效果显著。
- AugBERT在F1和精确率方面均优于EDA和回译,尤其在SDCNL数据集上,使用逻辑回归时F1分数提升了4.1%。
- 本研究发现AugBT在任一数据集上均未带来显著性能提升,p值分别为0.23568(Dreaddit)和0.40338(SDCNL),表明在此情境下其效用有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。