Skip to main content
QUICK REVIEW

[論文レビュー] HyenaDNA: Long-Range Genomic Sequence Modeling at Single Nucleotide Resolution

Éric Nguyen, Michael Poli|arXiv (Cornell University)|Jun 27, 2023
RNA and protein synthesis mechanisms被引用数 148
ひとこと要約

HyenaDNAは人間リファレンスゲノム上で最大100万トークンの文脈を単一ヌクレオチド解像度で事前学習し、パラメータ数を大幅に減らしつつ複数のゲノムベンチマークで最先端の結果を達成し、インコンテキスト学習と超長距離タスクを可能にします。

ABSTRACT

Genomic (DNA) sequences encode an enormous amount of information for gene regulation and protein synthesis. Similar to natural language models, researchers have proposed foundation models in genomics to learn generalizable features from unlabeled genome data that can then be fine-tuned for downstream tasks such as identifying regulatory elements. Due to the quadratic scaling of attention, previous Transformer-based genomic models have used 512 to 4k tokens as context (<0.001% of the human genome), significantly limiting the modeling of long-range interactions in DNA. In addition, these methods rely on tokenizers or fixed k-mers to aggregate meaningful DNA units, losing single nucleotide resolution where subtle genetic variations can completely alter protein function via single nucleotide polymorphisms (SNPs). Recently, Hyena, a large language model based on implicit convolutions was shown to match attention in quality while allowing longer context lengths and lower time complexity. Leveraging Hyena's new long-range capabilities, we present HyenaDNA, a genomic foundation model pretrained on the human reference genome with context lengths of up to 1 million tokens at the single nucleotide-level - an up to 500x increase over previous dense attention-based models. HyenaDNA scales sub-quadratically in sequence length (training up to 160x faster than Transformer), uses single nucleotide tokens, and has full global context at each layer. We explore what longer context enables - including the first use of in-context learning in genomics. On fine-tuned benchmarks from the Nucleotide Transformer, HyenaDNA reaches state-of-the-art (SotA) on 12 of 18 datasets using a model with orders of magnitude less parameters and pretraining data. On the GenomicBenchmarks, HyenaDNA surpasses SotA on 7 of 8 datasets on average by +10 accuracy points. Code at https://github.com/HazyResearch/hyena-dna.

研究の動機と目的

  • 長距離文脈ゲノムモデリングを動機づけ、SNPレベルの影響を捉えるために単一ヌクレオチド解像度を保持する。
  • 超長いDNA配列(最大1Mトークン)を処理可能なスケーラブルで注意機構を用いないモデル(HyenaDNA)の開発。
  • 長い文脈が事前学習 perplexity を改善し、インコンテキスト学習のような新たな下流機能を可能にすることを示す。
  • HyenaDNA がはるかに少ないパラメータとデータ量で複数のゲノムベンチマークでSotAの性能に達することを示す。)
  • method([

提案手法

  • アテンションの代替としてロング畳み込みとデータ制御ゲーティングを用いたデコーダー専用 Hyena アーキテクチャを採用。
  • 単一ヌクレオチドトークン(A, C, G, T, N, および特別トークン)と最大1,000,000の文脈長を持つ人間リファレンスゲノム上で訓練。
  • 超長い配列訓練を安定化させ、時間を短縮するためのシーケンス長ウォームアップスケジューラを導入。
  • FFTベースの実装を用いた暗黙の畳み込み(Hyena)により層ごとの計算をO(L log L)に実現。
  • 事前学習ウェイトを更新せずに下流適応を可能にするソフトプロンプト調整を適用(インコンテキスト学習)。
  • Transformer系ベースラインおよび GenomicBenchmarks/Nucleotide Transformer と比較して、多様な下流ゲノムタスクで評価。

実験結果

リサーチクエスチョン

  • RQ1従来の高密度注意モデルより長い長さのゲノム配列で、畳み込みベースの長文脈モデルは単一ヌクレオチド解像度を達成できるか?
  • RQ2インコンテキスト学習やソフトプロンプティを含む超長文脈ゲノム基盤モデルを活用したとき、どんな新しい機能が現れるか?
  • RQ3はるかに少ないパラメータとデータで HyenaDNA は標準的なゲノムベンチマークでどの程度性能を発揮するか?
  • RQ4より長い文脈が perplexity をどの程度改善し、種の分類など超長距離タスクを可能にするか?

主な発見

  • HyenaDNA は最大1,000,000トークンの文脈をサブ二次のスケーリングで実現し、1M文脈でのトランスフォーマーより160倍速い訓練速度を達成。
  • GenomicBenchmarks で HyenaDNA は8データセット中7データセットで SotA を達成し、平均で+10 ポイント、エンハンサー識別では最大で+20 まで上昇。
  • Nucleotide Transformer ベンチマークでは、 HyenaDNA は前モデルより桁違いに少ないパラメータと事前学習データ量で12/18データセットで SotA を上回った。
  • 919-染色体機能(DeepSEA)タスクで HyenaDNA はベースラインよりはるかに少ないパラメータで競合。
  • ソフトプロンプティと few-shot デモンストレーションを通じて HyenaDNA は効果的なインコンテキスト学習を示し、プロンプトトークンを追加するほど性能が向上。
  • HyenaDNA の埋め込みは biotype でクラスタリングされ、最も小さなモデルで最高の biotype F1 スコアを達成(72.0 F1、パラメータ7M)。
  • 5クラスの種分類タスクでは、HyenaDNA は1M文脈で99.5%の精度を達成し、Transformers がこの長さで不可能なタスクを解決。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。