Skip to main content
QUICK REVIEW

[논문 리뷰] Assigning function to protein-protein interactions: a weakly supervised BioBERT based approach using PubMed abstracts

Aparna Elangovan, Melissa B. Davis|arXiv (Cornell University)|2020. 08. 19.
Biomedical Text Mining and Ontologies인용 수 7
한 줄 요약

이 논문은 PubMed 초록을 채굴하여 단백질-단백질 상호작용(PPI)에 기능 유형을 자동으로 할당하는 약한 지도 학습 기반 BioBERT 모델인 PPI-BioBERT을 제안한다. 1,800만 건의 초록을 스캔함으로써 IntAct와 같은 데이터베이스에 기록된 PPI의 기능적 타입을 크게 확장하는 3,253개의 새로운 기능 유형이 부여된 PPI를 식별하였다. 전체 정밀도는 46%이며, 아세틸화의 경우 87%로 나타나 기대 이상의 성능을 보였다.

ABSTRACT

Motivation: Protein-protein interactions (PPI) are critical to the function of proteins in both normal and diseased cells, and many critical protein functions are mediated by interactions.Knowledge of the nature of these interactions is important for the construction of networks to analyse biological data. However, only a small percentage of PPIs captured in protein interaction databases have annotations of function available, e.g. only 4% of PPI are functionally annotated in the IntAct database. Here, we aim to label the function type of PPIs by extracting relationships described in PubMed abstracts. Method: We create a weakly supervised dataset from the IntAct PPI database containing interacting protein pairs with annotated function and associated abstracts from the PubMed database. We apply a state-of-the-art deep learning technique for biomedical natural language processing tasks, BioBERT, to build a model - dubbed PPI-BioBERT - for identifying the function of PPIs. In order to extract high quality PPI functions at large scale, we use an ensemble of PPI-BioBERT models to improve uncertainty estimation and apply an interaction type-specific threshold to counteract the effects of variations in the number of training samples per interaction type. Results: We scan 18 million PubMed abstracts to automatically identify 3253 new typed PPIs, including phosphorylation and acetylation interactions, with an overall precision of 46% (87% for acetylation) based on a human-reviewed sample. This work demonstrates that analysis of biomedical abstracts for PPI function extraction is a feasible approach to substantially increasing the number of interactions annotated with function captured in online databases.

연구 동기 및 목표

  • IntAct에 기록된 PPI 중 기능적으로 주석이 달린 비율이 4%에 불과한 단백질-단백질 상호작용(PPI)의 기능 주석 부족 문제를 해결하기 위해.
  • PubMed 초록의 텍스트 정보를 활용하여 PPI에 대해 인식 가능한 기능 유형(예: 인산화, 아세틸화 등)을 자동으로 할당하는 확장 가능한 방법을 개발하기 위해.
  • PPI 기능 유형 분류에서 데이터 부족과 클래스 불균형 문제를 약한 지도 학습과 앙상블 학습을 통해 극복하기 위해.
  • 딥 러닝 프레임워크 내에서 상호작용 유형별 임계값 설정을 통해 불확실성 추정과 분류 성능을 향상시키기 위해.

제안 방법

  • IntAct 데이터베이스의 PPI를 해당 PubMed 초록과 연결하여 약한 지도 학습 데이터셋을 구축한다.
  • 기능 유형이 알려진 PPI 데이터셋을 정제하여 BioBERT를 미세조정함으로써 PPI-BioBERT 모델을 구축한다.
  • 예측의 불확실성 추정과 내성 강도 향상을 위해 PPI-BioBERT 모델의 앙상블을 사용한다.
  • 다양한 기능 유형 간 훈련 샘플의 불균형 문제로 인한 성능 저하를 완화하기 위해 상호작용 유형별 분류 임계값을 적용한다.
  • 앙상블 모델을 사용해 1,800만 건의 PubMed 초록을 스캔하여 새로운 기능 유형이 부여된 PPI를 추출한다.
  • 정밀도와 신뢰성 평가를 위해 대표 샘플에 대한 인간 검토를 통해 예측 결과를 검증한다.

실험 결과

연구 질문

  • RQ1PubMed 초록에 대한 약한 지도 학습 기반 딥 러닝이 단백질-단백질 상호작용의 기능 유형을 효과적으로 식별하고 분류할 수 있는가?
  • RQ2학습 예제가 제한된 저자원 PPI 기능 유형에 대해 BioBERT 기반 모델이 얼마나 일반화 가능한가?
  • RQ3앙상블 모델링과 유형별 임계값 설정이 다양한 PPI 기능 유형 범주에 걸쳐 예측 신뢰성과 정밀도를 어떻게 향상시키는가?
  • RQ4대규모 생물의학 문헌 코퍼스에 적용했을 때, 자동 PPI 기능 추출의 확장성과 정확도는 어느 정도인가?

주요 결과

  • 모델은 1,800만 건의 PubMed 초록에서 3,253개의 새로운 기능 유형이 부여된 PPI를 성공적으로 추출하여 기능 주석이 부여된 PPI의 수를 크게 증가시켰다.
  • 인간 검토 기반 샘플링을 통해 예측의 전체 정밀도는 46%로 나타나 대규모 적용에서도 신뢰할 수 있는 성능를 확보하였다.
  • 아세틸화 상호작용의 경우 정밀도가 87%에 도달하여 특정이고 잘 표현된 기능 유형에 대해 뛰어난 성능를 보였다.
  • 앙상블 모델링을 통해 불확실성 추정이 향상되어 저신뢰도 예측에서 모델의 신뢰도가 높아졌다.
  • 유형별 임계값 설정이 기능 유형 간 훈련 데이터 불균형으로 인한 성능 변동을 효과적으로 완화시켰다.
  • 이 방법은 대규모 PPI 기능 주석에 대해 실현 가능하며, 수동 코딩에 대한 확장 가능한 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.