Skip to main content
QUICK REVIEW

[논문 리뷰] AUC-maximized Deep Convolutional Neural Fields for Sequence Labeling

Sheng Wang, Siqi Sun|arXiv (Cornell University)|2015. 11. 17.
Machine Learning in Bioinformatics참고 문헌 31인용 수 9
한 줄 요약

이 논문은 불균형 데이터에서 시퀀스 레이블링을 위한 AUC 최적화된 딥 컨volution 신경장(DeepCNF)을 제안한다. DCNN와 CRF를 통합하여 제안된 방법은 AUC를 이원적 순위 매기기 목적 함수로 설정하고, 다항식 근사와 L-BFGS를 통해 최적화함으로써, 단백질 시퀀스 레이블링 세 가지 과제에서 최신 기술 수준의 성능을 달성한다. 특히 불균형도가 높은 데이터(예: 이질성 및 8상태 2차 구조 예측)에서 기존 표준 방법보다 뛰어난 성능을 보였다.

ABSTRACT

Deep Convolutional Neural Networks (DCNN) has shown excellent performance in a variety of machine learning tasks. This manuscript presents Deep Convolutional Neural Fields (DeepCNF), a combination of DCNN with Conditional Random Field (CRF), for sequence labeling with highly imbalanced label distribution. The widely-used training methods, such as maximum-likelihood and maximum labelwise accuracy, do not work well on highly imbalanced data. To handle this, we present a new training algorithm called maximum-AUC for DeepCNF. That is, we train DeepCNF by directly maximizing the empirical Area Under the ROC Curve (AUC), which is an unbiased measurement for imbalanced data. To fulfill this, we formulate AUC in a pairwise ranking framework, approximate it by a polynomial function and then apply a gradient-based procedure to optimize it. We then test our AUC-maximized DeepCNF on three very different protein sequence labeling tasks: solvent accessibility prediction, 8-state secondary structure prediction, and disorder prediction. Our experimental results confirm that maximum-AUC greatly outperforms the other two training methods on 8-state secondary structure prediction and disorder prediction since their label distributions are highly imbalanced and also have similar performance as the other two training methods on the solvent accessibility prediction problem which has three equally-distributed labels. Furthermore, our experimental results also show that our AUC-trained DeepCNF models greatly outperform existing popular predictors of these three tasks.

연구 동기 및 목표

  • 매우 불균형한 레이블 분포를 가진 시퀀스 레이블링 과제에서 최대우도(ML) 및 레이블별 정확도와 같은 기존 학습 방법의 열악한 성능을 해결한다.
  • 불균형 데이터에 대해 강건한 지표인 ROC 곡선 아래 면적(AUC)을 직접 최적화하는 새로운 학습 알고리즘을 개발한다. 이는 구조적 시퀀스 모델링 맥락에서 수행된다.
  • 딥 컨volution 신경망(DCNN)과 선형 체인 조건부 랜덤 필드(CRF)를 통합하여 단백질 시퀀스의 장거리 의존성을 모델링한다.
  • 용적 레이블 균형이 다양한 실제 생물학적 시퀀스 레이블링 문제(용매 접근성, 이질성 예측, 8상태 2차 구조 예측 포함)에서 AUC 기반 학습의 우수성을 입증한다.
  • 모든 세 가지 벤치마크 단백질 시퀀스 레이블링 과제에서 최신 기술 수준의 성능을 달성하며, 특히 불균형 데이터셋에서 희귀 클래스에 대해 뛰어난 성능을 발휘한다.

제안 방법

  • 구조적 시퀀스 모델에서 최적화 가능하도록 AUC를 양성 및 음성 샘플 간의 이원적 순위 매기기 목적 함수로 공식화한다.
  • 다항식 기반 체비셰프 근사를 사용하여 AUC 함수를 미분 가능하게 근사함으로써 기울기 기반 최적화에 적합하게 만든다.
  • 미분 가능한 AUC 목적 함수를 딥 컨volution 신경장(DeepCNF) 프레임워크에 통합하여 DCNN와 선형 체인 CRF를 조합하여 시퀀스 레이블링을 수행한다.
  • 모델 파라미터를 종단 간 최적화하기 위해 L-BFGS 알고리즘을 사용하여 AUC 목적 함수를 최적화함으로써 특징 표현과 CRF 잠재변수의 공동 학습을 가능하게 한다.
  • DCNN 아키텍처와 학습 방법의 다양성에 따라 성능을 평가하기 위해 JPRED 데이터셋에서 7중 교차검증을 수행한다.
  • 균형 잡힌 지표를 사용하여 성능을 평가한다: 평균 Mcc와 평균 AUC이며, 특히 불균형 데이터셋에서 희귀 클래스에 중점을 둔다.

실험 결과

연구 질문

  • RQ1매우 불균형한 레이블 분포를 가진 시퀀스 레이블링에서 AUC 직접 최적화가 최대우도 및 최대 레이블별 정확도보다 뛰어나게 성능을 높일 수 있는가?
  • RQ2AUC 기반 학습은 이질성 예측 및 8상태 2차 구조 예측과 같은 단백질 시퀀스 레이블링 과제에서 희귀 클래스 성능에 어떤 영향을 미치는가?
  • RQ3제안된 AUC 최적화 DeepCNF 모델은 레이블 균형이 다양한 생물학적 시퀀스 레이블링 문제에서 최신 기술 수준의 성능을 달성하는가?
  • RQ4다양한 학습 목표 하에서 아키텍처 선택(예: 레이어 수, 뉴런 수, 커널 크기)에 따른 성능 민감도는 어떠한가?
  • RQ5AUC 최적화는 다수 클래스 성능을 유지하면서 소수 클래스 예측 품질을 얼마나 향상시키는가?

주요 결과

  • 이질성 예측(DISO)은 매우 불균형한 레이블 분포(~6% 이질성 잔여물)를 보이며, 최대-AUC는 평균 Mcc 0.51과 평균 AUC 0.89를 기록하여 최대우도 및 최대 레이블별 정확도보다 유의미하게 뛰어난 성능을 보였다.
  • 8상태 2차 구조 예측(SS8)은 3-10 헬릭스, 베타 브릿지, 파이-헬릭스와 같은 희귀 레이블을 포함하며, 최대-AUC는 평균 Mcc 0.44와 평균 AUC 0.86을 기록하여 최대 레이블별 정확도(평균 Mcc: 0.41, 평균 AUC < 0.8)를 능가했다.
  • 용매 접근성 예측(ACC)은 거의 균일한 레이블 분포(세 클래스)를 보이며, 모든 세 학습 방법이 유사하게 작동했고, Q3 정확도 0.69, 평균 Mcc 0.45, 평균 AUC 0.82를 기록했다.
  • 모든 과제에 최적의 DeepCNF 아키텍처는 4–5개의 히든 레이어, 레이어당 50–100개의 뉴런, 커널 크기 11로 구성되었으며, 깊이 또는 너비를 더 증가시켜도 성능 향상이 없었다.
  • 최대-AUC 학습은 유사한 특이도 수준에서 희귀 레이블에 대해 더 높은 정밀도와 민감도를 달성하여, 클래스 불균형 문제 해결에 효과적임을 입증했다.
  • AUC 최적화 DeepCNF 모델은 모든 세 단백질 시퀀스 레이블링 과제에서 최신 기술 수준의 성능을 달성하였으며, 기존 인기 예측기보다 벤치마크 데이터셋에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.