Skip to main content
QUICK REVIEW

[논문 리뷰] A 5' UTR Language Model for Decoding Untranslated Regions of mRNA and Function Predictions

Yanyi Chu, Dan Yu|arXiv (Cornell University)|2023. 10. 05.
RNA and protein synthesis mechanisms인용 수 5
한 줄 요약

이 논문은 다중 종의 5' UTR에서 사전 훈련된 딥러닝 언어 모델인 UTR-LM을 소개한다. 이 모델은 이차 구조 및 최소 자유 에너지와 같은 구조적 특징으로 미세조정되었으며, 번역 효율성과 mRNA 발현 예측에서 최대 60% 향상을 달성했고, 211개의 합성 5' UTR에 대한 실험적 검증을 통해 단백질 수확량을 32.5% 증가시켰다.

ABSTRACT

The 5' UTR, a regulatory region at the beginning of an mRNA molecule, plays a crucial role in regulating the translation process and impacts the protein expression level. Language models have showcased their effectiveness in decoding the functions of protein and genome sequences. Here, we introduced a language model for 5' UTR, which we refer to as the UTR-LM. The UTR-LM is pre-trained on endogenous 5' UTRs from multiple species and is further augmented with supervised information including secondary structure and minimum free energy. We fine-tuned the UTR-LM in a variety of downstream tasks. The model outperformed the best-known benchmark by up to 42% for predicting the Mean Ribosome Loading, and by up to 60% for predicting the Translation Efficiency and the mRNA Expression Level. The model also applies to identifying unannotated Internal Ribosome Entry Sites within the untranslated region and improves the AUPR from 0.37 to 0.52 compared to the best baseline. Further, we designed a library of 211 novel 5' UTRs with high predicted values of translation efficiency and evaluated them via a wet-lab assay. Experiment results confirmed that our top designs achieved a 32.5% increase in protein production level relative to well-established 5' UTR optimized for therapeutics.

연구 동기 및 목표

  • 5' UTR 내의 조절 기능을 해독할 수 있는 딥러닝 모델을 개발하여 번역 조절과 단백질 발현에 핵심적인 역할을 하는 것을 목표로 한다.
  • 리보솜 부착, 번역 효율성, mRNA 발현 수준과 같은 핵심 번역 조절 특징의 예측 정확도를 향상시키는 것.
  • 감독된 구조적 데이터를 활용하여 5' UTR 내에 미annotated된 내부 리보솜 통합 부위(IRES)를 식별하는 것.
  • 생물공학적 적용을 위한 최적화된 번역 효율성을 갖춘 합성 5' UTR를 설계하고 실험적으로 검증하는 것.

제안 방법

  • 다양한 종의 내재 5' UTR 서열을 기반으로 UTR-LM을 사전 훈련하여 서열 수준의 조절 패턴을 학습한다.
  • 이차 구조 및 최소 자유 에너지 데이터를 감독 데이터로 통합하여 구조적 맥락 이해 능력을 향상시킨다.
  • 리보솜 부착, 번역 효율성, mRNA 발현 수준 예측과 같은 후행 작업에 대해 UTR-LM을 미세조정한다.
  • 이중 구조가 높은 안정성을 가지는 IRES 유사 서열 모티프를 식별하여 잠재적인 내부 리보솜 통합 부위(IRES)를 스크리닝한다.
  • UTR-LM 출력 기반으로 높은 번역 효율성을 예측한 211개의 서열로 구성된 합성 5' UTR 라이브러리를 설계한다.
  • 실제 단백질 생산 수준을 측정하기 위해 습기 실험(웨트랩) 분석을 통해 상위 성능을 보인 합성 5' UTR를 검증한다.

실험 결과

연구 질문

  • RQ1다중 종의 5' UTR 서열로 훈련된 딥러닝 언어 모델이 기존 벤치마크보다 번역 효율성과 리보솜 부착 예측에서 뛰어난 성능을 보일 수 있는가?
  • RQ2이차 구조 및 최소 자유 에너지 데이터를 통합할 경우 5' UTR 언어 모델의 예측 성능이 얼마나 향상되는가?
  • RQ3모델이 기존 최고 수준의 방법보다 더 높은 정밀도로 미annotated된 내부 리보솜 통합 부위(IRES)를 식별할 수 있는가?
  • RQ4UTR-LM 가이드 설계를 통한 합성 5' UTR가 실험적 검증에서 단백질 발현에 측정 가능한 향상을 이끌 수 있는가?

주요 결과

  • UTR-LM는 기존 최고의 벤치마크 대비 평균 리보솜 부착 예측에서 최대 42% 향상된 성능을 기록했다.
  • 번역 효율성과 mRNA 발현 수준 예측 정확도는 기존 최고의 베이스라인 대비 최대 60% 향상되었다.
  • UTR-LM는 IRES 탐지 성능을 향상시켜 강력한 베이스라인 대비 AUPR를 0.37에서 0.52로 상승시켰다.
  • 합성 라이브러리에서 상위 5' UTR 설계는 잘 알려진 치료용 5' UTR 대비 단백질 생산량을 32.5% 증가시켰다.
  • 내재 5' UTR를 다중 종에서 사전 훈련함으로써 모델은 종 간 일반화 능력이 뛰어났다.
  • 이중 구조 및 최소 자유 에너지 등의 구조적 특징 통합은 후행 예측 성능을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.