Skip to main content
QUICK REVIEW

[論文レビュー] A 5' UTR Language Model for Decoding Untranslated Regions of mRNA and Function Predictions

Yanyi Chu, Dan Yu|arXiv (Cornell University)|Oct 5, 2023
RNA and protein synthesis mechanisms被引用数 5
ひとこと要約

この論文では、多種の5' UTRを事前学習し、二次構造や最小自由エネルギーなどの構造的特徴で微調整した深層学習言語モデル、UTR-LMを紹介する。UTR-LMは翻訳効率およびmRNA発現の予測において最大60%の向上を達成し、32.5%のタンパク質産出量の増加を示す211個の合成5' UTRの実験的検証を可能にした。

ABSTRACT

The 5' UTR, a regulatory region at the beginning of an mRNA molecule, plays a crucial role in regulating the translation process and impacts the protein expression level. Language models have showcased their effectiveness in decoding the functions of protein and genome sequences. Here, we introduced a language model for 5' UTR, which we refer to as the UTR-LM. The UTR-LM is pre-trained on endogenous 5' UTRs from multiple species and is further augmented with supervised information including secondary structure and minimum free energy. We fine-tuned the UTR-LM in a variety of downstream tasks. The model outperformed the best-known benchmark by up to 42% for predicting the Mean Ribosome Loading, and by up to 60% for predicting the Translation Efficiency and the mRNA Expression Level. The model also applies to identifying unannotated Internal Ribosome Entry Sites within the untranslated region and improves the AUPR from 0.37 to 0.52 compared to the best baseline. Further, we designed a library of 211 novel 5' UTRs with high predicted values of translation efficiency and evaluated them via a wet-lab assay. Experiment results confirmed that our top designs achieved a 32.5% increase in protein production level relative to well-established 5' UTR optimized for therapeutics.

研究の動機と目的

  • 5' UTR内の制御機能を解読できる深層学習モデルの開発。これは翻訳制御およびタンパク質発現において重要な役割を果たす。
  • リボソームの負荷、翻訳効率、mRNA発現レベルといった主要な翻訳調節特徴の予測精度の向上。
  • 教師あり構造データを用いて、5' UTR内に未同定の内部リボソーム進入部位(IRES)を同定すること。
  • バイオテクノロジー的応用を目的とした、最適化された翻訳効率を持つ合成5' UTRの設計および実験的検証。

提案手法

  • 複数種のエンドゲノム由来5' UTR配列を用いてUTR-LMを事前学習し、配列レベルの調節パターンを学習する。
  • 二次構造および最小自由エネルギーの教師ありデータを統合することで、構造的文脈の理解を向上させる。
  • リボソーム負荷、翻訳効率、mRNA発現レベル予測といった下流タスクに対してUTR-LMを微調整する。
  • 高い構造的安定性を示すIRES様配列モチーフを同定することで、IRESのスクリーニングを実施する。
  • UTR-LMの出力に基づき、高い翻訳効率が予測される211配列の合成5' UTRライブラリを設計する。
  • 実際にタンパク質産出量を測定するため、湿潤実験法を用いて上位性能を示す合成5' UTRを検証する。

実験結果

リサーチクエスチョン

  • RQ1多種の5' UTR配列で学習した深層学習言語モデルは、翻訳効率およびリボソーム負荷の予測において、既存のベンチマークを上回る性能を示せるか?
  • RQ2二次構造および最小自由エネルギーのデータを統合することで、5' UTR言語モデルの予測性能はどの程度向上するか?
  • RQ3本モデルは、現在の最先端手法よりも高い精度で未同定の内部リボソーム進入部位(IRES)を同定できるか?
  • RQ4UTR-LMを用いた合成5' UTRの設計は、実験的検証においてタンパク質発現の顕著な向上をもたらすか?

主な発見

  • UTR-LMは、最高の既存ベンチマークと比較して、平均リボソーム負荷の予測において最大42%の向上を達成した。
  • 翻訳効率およびmRNA発現レベルの予測精度は、最高のベースラインと比較して最大60%向上した。
  • UTR-LMはIRES検出性能を向上させ、AUPRを0.37から0.52に向上させた(強力なベースラインと比較)。
  • 合成ライブラリから得られた上位5' UTR設計は、標準的な治療的5' UTRと比較してタンパク質産出量が32.5%増加した。
  • エンドゲノム由来5' UTRを多様な種で事前学習したことで、UTR-LMは種を超えた良好な一般化性能を示した。
  • 二次構造および最小自由エネルギーといった構造的特徴の統合により、下流の予測性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。