[論文レビュー] Reprogramming Pretrained Language Models for Protein Sequence Representation Learning
この論文は、英語の言語モデルとタンパク質配列の埋め込み表現の間でスパースな線形マッピングを学習することにより、事前学習済みの英語言語モデルをタンパク質配列表現学習に再プログラミングするフレームワークR2DLを紹介する。R2DLは、多様なタンパク質性質および機能予測タスクにおいて、標準的な教師あり学習および事前学習ベースラインと比較して最大10⁵倍のデータ効率を達成し、最先端の性能を実現する。
Machine Learning-guided solutions for protein learning tasks have made significant headway in recent years. However, success in scientific discovery tasks is limited by the accessibility of well-defined and labeled in-domain data. To tackle the low-data constraint, recent adaptions of deep learning models pretrained on millions of protein sequences have shown promise; however, the construction of such domain-specific large-scale model is computationally expensive. Here, we propose Representation Learning via Dictionary Learning (R2DL), an end-to-end representation learning framework in which we reprogram deep models for alternate-domain tasks that can perform well on protein property prediction with significantly fewer training samples. R2DL reprograms a pretrained English language model to learn the embeddings of protein sequences, by learning a sparse linear mapping between English and protein sequence vocabulary embeddings. Our model can attain better accuracy and significantly improve the data efficiency by up to $10^5$ times over the baselines set by pretrained and standard supervised methods. To this end, we reprogram an off-the-shelf pre-trained English language transformer and benchmark it on a set of protein physicochemical prediction tasks (secondary structure, stability, homology, stability) as well as on a biomedically relevant set of protein function prediction tasks (antimicrobial, toxicity, antibody affinity).
研究の動機と目的
- タンパク質機械学習におけるラベル付きデータの限界に取り組むために、データ効率の高い表現学習を可能にする。
- 計算コストが高く、ドメイン特化された大規模タンパク質言語モデルの事前学習に代わる軽量な代替手法を開発する。
- 高容量で市販の英語言語モデルをタンパク質配列に再利用することで、クロスドメイン転移学習を検討する。
- 初期学習からモデルを再訓練せずに、タンパク質表現学習におけるデータ効率を向上させる。
- 最小限のラベル付きデータで高精度なタンパク質性質および機能予測を可能にする。
提案手法
- R2DLは、トランスフォーマーのトークン埋め込みとタンパク質配列埋め込みの間でスパースな線形変換を学習することで、事前学習済みの英語トランスフォーマーを再プログラミングする。
- 本手法は、k-SVDに基づく辞書学習を用いて、英語言語モデルの埋め込みからタンパク質配列埋め込みへのスパースマッピングを学習する。
- L₀ノルムを用いた正則化された目的関数により、学習された変換行列のスパarsityを強制することで、一般化性能とデータ効率を向上させる。
- フレームワークは、元の言語モデルのファインチューニングを一切行わずに、学習されたマッピングを用いてタンパク質配列上でエンドツーエンドで訓練される。
- 本モデルは、元の英語言語モデルが事前に学習した言語的インダクティブバイアスを活用し、タンパク質配列に生物学的に意味のある表現を捉える。
- 本アプローチは、二次構造、安定性、溶解性、相同性、および機能予測(抗菌性、毒性、抗体親和性など)を含む複数のタンパク質タスクで評価される。
![Figure 1 : Left: Descriptions of considered predictive tasks. We select the set of physicochemical property prediction tasks from the well-studied domains in [ 6 ] , and the biomedical function prediction tasks from works with biomedically relevant small-szied labeled datasets [ 3 ; 14 ] . Center: W](https://ar5iv.labs.arxiv.org/html/2301.02120/assets/new_figs/fig_1.png)
実験結果
リサーチクエスチョン
- RQ1事前学習済みの英語言語モデルをファインチューニングせずに、意味のあるタンパク質配列表現を学習するために効果的に再プログラミング可能か?
- RQ2自然言語からタンパク質配列へのクロスドメイン転移学習は、タンパク質機械学習タスクにおけるデータ効率をどの程度向上させるか?
- RQ3低データ環境下において、R2DLの性能は標準的な教師あり学習とドメイン特化された事前学習と比較してどうなるか?
- RQ4言語モデルの埋め込みとタンパク質配列の間でスパースな線形マッピングを適用することで、多様な生物学的タスクで競争力のある結果が得られるか?
- RQ5再プログラミングされた基盤モデルを用いたタンパク質表現学習で達成可能なデータ効率の上限は何か?
主な発見
- R2DLは、二次構造、安定性、溶解性、相同性、抗菌性、毒性、および抗体親和性予測を含む、評価されたすべてのタンパク質予測タスクで最先端の性能を達成する。
- 標準的な教師あり学習および事前学習ベースラインと比較して、最大10⁵倍のデータ効率を向上させ、最小限のラベル付きデータで高精度を実現する。
- 抗菌性予測タスクでは、6,489件の訓練サンプルのみで88%の精度を達成し、事前学習済みトランスフォーマーと同等の性能を示したが、はるかに少ないデータ要件で達成された。
- 毒性予測タスクでは、わずか8,153個のラベル付きサンプルを用いて93.78%の精度を達成し、低データ環境下で標準的な教師あり手法を上回った。
- 相同性分類タスクでは、10,438個の訓練サンプルで26%のTop-1精度を達成し、LSTMベースラインと同等の性能を示したが、はるかに効率的なフレームワークを実現した。
- 本フレームワークは、物理的・化学的性質予測および医療的関連性の高い機能予測を含む多様な生物学的タスクに広く適応可能であり、一貫したデータ効率の向上が見られた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。