Skip to main content
QUICK REVIEW

[논문 리뷰] DNAGPT: A Generalized Pre-trained Tool for Versatile DNA Sequence Analysis Tasks

Daoan Zhang, Weitong Zhang|arXiv (Cornell University)|2023. 07. 11.
Genomics and Phylogenetic Studies인용 수 12
한 줄 요약

DNAGPT는 시퀀스와 수치 데이터를 모두 처리하는 다중 작업 학습 체계를 통해 다양한 종 간 하위 작업을 가능하게 하는 일반화된 DNA 사전 학습 모델입니다.

ABSTRACT

Pre-trained large language models demonstrate potential in extracting information from DNA sequences, yet adapting to a variety of tasks and data modalities remains a challenge. To address this, we propose DNAGPT, a generalized DNA pre-training model trained on over 200 billion base pairs from all mammals. By enhancing the classic GPT model with a binary classification task (DNA sequence order), a numerical regression task (guanine-cytosine content prediction), and a comprehensive token language, DNAGPT can handle versatile DNA analysis tasks while processing both sequence and numerical data. Our evaluation of genomic signal and region recognition, mRNA abundance regression, and artificial genomes generation tasks demonstrates DNAGPT's superior performance compared to existing models designed for specific downstream tasks, benefiting from pre-training using the newly designed model structure.

연구 동기 및 목표

  • DNA 서열과 수치 출력을 모두 다룰 수 있는 단일 모델의 필요성을 제시한다.
  • 시퀀스, 수치, 이진 태스크를 포함하는 다중 작업 사전 학습 프레임워크를 설계한다.
  • 시퀀스와 숫자 데이터를 함께 처리하는 토큰 언어와 아키텍처를 개발한다.
  • 종 간에 유전체 신호 및 영역 인식, mRNA 발현량 예측, 인공 게놈 생성을 통해 DNAGPT를 평가한다.

제안 방법

  • 시퀀스 토큰과 숫자 토큰을 갖춘 GPT 유사 트랜스포머를 확장한다.
  • 다음 토큰 예측, GC 함량 예측, 시퀀스 순서 예측의 세 가지 사전 학습 태스크를 도입한다.
  • 겹치지 않는 k-mer로 구성된 계층적 DNA 토큰 언어를 도입하여 단어, 문장, 단락을 형성한다.
  • 다수의 모델 변형(DNAGPT-H, DNAGPT-M, DNAGPT-S-512, DNAGPT-B-512) 전반에 걸쳐 포유류 참고 게놈에서 2000억개 염기쌍이 넘는 데이터를 학습한다.
  • 제로샷 가능성을 유지하면서 분류 및 회귀를 위한 태스크 특화 헤드를 사용해 다운스트림 태스크에 맞게 DNAGPT를 미세조정한다.

실험 결과

연구 질문

  • RQ1단일 일반화된 사전 학습 모델이 다양한 태스크를 위해 DNA 시퀀스와 수치 데이터를 함께 처리할 수 있는가?
  • RQ2종 간 교차 학습이 GSR 인식, mRNA 발현량, 게놈 생성의 성능에 어떤 영향을 미치는가?
  • RQ3설계된 토큰 언어와 다중 작업 사전 학습의 DNA 분석에 대한 이점과 한계는 무엇인가?

주요 결과

  • DNAGPT는 인간, 쥐, 소, 초파이에서 유전체 신호 및 영역 인식에서 최첨단 태스크 특화 방법과 비교해 우수한 성능을 달성한다.
  • DNAGPT는 DNA 시퀀스와 mRNA 반감기 데이터를 결합할 때 mRNA 발현량 예측에서 특화 모델보다 우수하다.
  • DNAGPT는 GAN/RBM 베이스라인보다 실제 게놈 통계(PCs, 대립유전자 빈도, LD)에 더 잘 일치하는 인공 인간 게놈을 생성한다.
  • 어텐션 시각화는 DNAGPT가 TIS와 PAS 같은 게놈 신호를 식별하기 위해 비코딩 영역에 주로 집중함을 시사한다.
  • 생물종 간 태스크에서 더 큰 사전 학습 데이터가 다운스트림 성능을 향상시킨다(H, M, S-512 변형).
  • 생성 온도 분석은 합성 게놈에서 다양성과 정확도 간의 조절 가능성을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.