[论文解读] AUC-maximized Deep Convolutional Neural Fields for Sequence Labeling
本文提出AUC最大化的深度卷积神经场(DeepCNF),将DCNN与CRF结合,用于处理类别不平衡数据的序列标注。通过将AUC表述为成对排序目标,并利用多项式逼近和L-BFGS进行优化,该方法在三个蛋白质序列标注任务上达到最先进性能,尤其在高度不平衡数据(如disorder和8状态二级结构预测)上显著优于标准方法。
Deep Convolutional Neural Networks (DCNN) has shown excellent performance in a variety of machine learning tasks. This manuscript presents Deep Convolutional Neural Fields (DeepCNF), a combination of DCNN with Conditional Random Field (CRF), for sequence labeling with highly imbalanced label distribution. The widely-used training methods, such as maximum-likelihood and maximum labelwise accuracy, do not work well on highly imbalanced data. To handle this, we present a new training algorithm called maximum-AUC for DeepCNF. That is, we train DeepCNF by directly maximizing the empirical Area Under the ROC Curve (AUC), which is an unbiased measurement for imbalanced data. To fulfill this, we formulate AUC in a pairwise ranking framework, approximate it by a polynomial function and then apply a gradient-based procedure to optimize it. We then test our AUC-maximized DeepCNF on three very different protein sequence labeling tasks: solvent accessibility prediction, 8-state secondary structure prediction, and disorder prediction. Our experimental results confirm that maximum-AUC greatly outperforms the other two training methods on 8-state secondary structure prediction and disorder prediction since their label distributions are highly imbalanced and also have similar performance as the other two training methods on the solvent accessibility prediction problem which has three equally-distributed labels. Furthermore, our experimental results also show that our AUC-trained DeepCNF models greatly outperform existing popular predictors of these three tasks.
研究动机与目标
- 解决标准训练方法(如最大似然和逐标签准确率)在标签分布高度不平衡的序列标注任务中表现不佳的问题。
- 开发一种新型训练算法,直接在结构化序列建模背景下优化受试者工作特征曲线下面积(AUC),该指标对不平衡数据具有鲁棒性。
- 将深度卷积神经网络(DCNN)与线性链条件随机场(CRF)结合,以建模蛋白质序列中的长程依赖关系。
- 在真实世界生物序列标注问题中展示基于AUC的训练优势,涵盖不同标签平衡程度的任务,包括溶剂可及性、无序性预测和8状态二级结构预测。
- 在所有三个基准蛋白质序列标注任务中均达到最先进性能,尤其在高度不平衡数据集中稀有类别的表现上尤为突出。
提出的方法
- 将AUC表述为正样本与负样本之间的成对排序目标,以实现结构化序列模型中的优化。
- 采用基于多项式的切比雪夫逼近方法对AUC函数进行近似,使其可微分并适用于基于梯度的优化。
- 将可微分的AUC目标集成到结合DCNN与线性链CRF的深度卷积神经场(DeepCNF)框架中,用于序列标注。
- 使用L-BFGS算法优化AUC目标,端到端更新模型参数,实现特征表示与CRF势函数的联合学习。
- 在JPRED数据集上采用7折交叉验证,评估不同DCNN架构和训练方法下的模型性能。
- 使用平衡指标评估性能:平均MCC和平均AUC,尤其关注高度不平衡数据集中稀有类别的表现。
实验结果
研究问题
- RQ1在标签分布高度不平衡的序列标注任务中,直接AUC最大化是否能优于最大似然和最大逐标签准确率?
- RQ2基于AUC的训练在蛋白质序列标注任务中(如无序性预测和8状态二级结构预测)对稀有类别的性能有何影响?
- RQ3所提出的AUC最大化的DeepCNF模型是否在不同标签平衡程度的多样化生物序列标注问题中均达到最先进性能?
- RQ4在不同训练目标下,模型性能对网络架构选择(如层数、神经元数、卷积核大小)的敏感性如何?
- RQ5AUC最大化在提升少数类预测质量的同时,对多数类性能的影响程度如何?
主要发现
- 在无序性预测(DISO)任务中,标签分布高度不平衡(约6%为无序残基),最大AUC方法达到平均MCC为0.51,平均AUC为0.89,显著优于最大似然和最大逐标签准确率方法。
- 在8状态二级结构预测(SS8)任务中,包含稀有标签如3-10螺旋、β桥和π螺旋,最大AUC方法达到平均MCC为0.44,平均AUC为0.86,优于最大逐标签准确率(平均MCC:0.41,平均AUC < 0.8)。
- 在溶剂可及性预测(ACC)任务中,标签分布接近均匀(三类),三种训练方法表现相近,Q3准确率为0.69,平均MCC为0.45,平均AUC为0.82。
- 所有任务的最优DeepCNF架构均为4–5层隐藏层,每层50–100个神经元,卷积核大小为11;进一步增加深度或宽度并未提升性能。
- 最大AUC训练在保持相似特异性水平的同时,显著提升了稀有标签的精确率和灵敏度,证明了其在处理类别不平衡问题上的有效性。
- AUC最大化的DeepCNF模型在所有三个蛋白质序列标注任务中均达到最先进性能,在基准数据集上超越了现有主流预测工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。