Skip to main content
QUICK REVIEW

[論文レビュー] DNAGPT: A Generalized Pre-trained Tool for Versatile DNA Sequence Analysis Tasks

Daoan Zhang, Weitong Zhang|arXiv (Cornell University)|Jul 11, 2023
Genomics and Phylogenetic Studies被引用数 12
ひとこと要約

DNAGPTはDNAのシーケンスデータと数値データの両方を扱う一般化された事前学習モデルで、マルチタスク訓練方式を通じて、種を超えた多様な下流タスクを可能にする。

ABSTRACT

Pre-trained large language models demonstrate potential in extracting information from DNA sequences, yet adapting to a variety of tasks and data modalities remains a challenge. To address this, we propose DNAGPT, a generalized DNA pre-training model trained on over 200 billion base pairs from all mammals. By enhancing the classic GPT model with a binary classification task (DNA sequence order), a numerical regression task (guanine-cytosine content prediction), and a comprehensive token language, DNAGPT can handle versatile DNA analysis tasks while processing both sequence and numerical data. Our evaluation of genomic signal and region recognition, mRNA abundance regression, and artificial genomes generation tasks demonstrates DNAGPT's superior performance compared to existing models designed for specific downstream tasks, benefiting from pre-training using the newly designed model structure.

研究の動機と目的

  • DNA配列と数値出力の両方を扱える統一モデルの必要性を動機づける。
  • シーケンス、数値、および2値タスクを含むマルチタスク事前学習フレームワークを設計する。
  • シーケンスデータと数値データを同時に処理するトークン言語とアーキテクチャを開発する。
  • 種を横断するゲノム信号と領域認識、mRNA発現量予測、および人工ゲノム生成におけるDNAGPTを評価する。

提案手法

  • シーケンストークンと数値トークンを用いたGPT風トランスフォーマーを拡張する。
  • 次のトークン予測、GC含量予測、シーケンス順序予測の3つの事前学習タスクを導入する。
  • 非重複のk-merを用いた階層的なDNAトークン言語を組み込み、語、文、段落を形成する。
  • DNAGPT-H、DNAGPT-M、DNAGPT-S-512、DNAGPT-B-512など、複数のモデルバリアントに渡る200 billion base pairsの哺乳類リファレンスゲノムで訓練する。
  • 下流タスクのためにDNAGPTをファインチューニングし、分類と回帰のタスク固有ヘッドを用いながら、ゼロショットポテンシャルを保つためベースモデルを保持する。

実験結果

リサーチクエスチョン

  • RQ1単一の一般化された事前学習モデルは、DNA配列と数値データを多様なタスクに対して同時に扱ることができるか。
  • RQ2種を横断した事前学習は、GSR認識、mRNA発現量予測、ゲノム生成の性能にどのように影響するか。
  • RQ3設計されたトークン言語とマルチタスク事前学習のDNA解析における利点と制約は何か。

主な発見

  • DNAGPTは、ヒト、マウス、牛、ショウジョウバエにわたるゲノム信号および領域認識で、最先端のタスク特化手法より優れた性能を達成する。
  • DNA配列とmRNA半減期データを組み合わせた場合、DNAGPTはmRNA発現量予測で専門モデルを上回る。
  • DNAGPTはGAN/RBMベースラインよりも実ゲノム統計(PCs、アレル頻度、LD)との整合性が高い人工ヒトゲノムを生成する。
  • アテンションの可視化は、DNAGPTが非コード領域に焦点を当て、TISやPASなどのゲノム信号を識別することを示している。
  • 生物種を横断するタスクでは、より大規模な事前学習データが下流の性能を向上させる(H、M、S-512バリアント)。
  • 生成温度の解析は、合成ゲノムにおける多様性と忠実度の制御可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。