[논문 리뷰] RNA-Seq Mapping Errors When Using Incomplete Reference Transcriptomes of Vertebrates
이 연구는 불완전한 참조 전사체와 대안 스플라이싱이 RNA-Seq 리드 매핑 및 발현 정량화에 오류를 유발하는 방식을 조사한다. 시뮬레이션된 전사체와 리드를 사용하여, 누락된 전사체는 참 양성 매핑 비율을 감소시키고, 스플라이싱 변형 간에 공유되는 엑손은 거짓 양성 수를 증가시킨다; 유전자별 또는 리드 공유를 통한 전사체 그룹화는 정확도를 향상시킬 수 있지만, 오직 완전한 참조 전사체만이 문제를 완전히 해결할 수 있으며, 더 긴 리드(1 kb 이상)가 공유 엑손으로 인한 모호성을 줄이기 위해 필요하다.
Whole transcriptome sequencing is increasingly being used as a functional genomics tool to study non- model organisms. However, when the reference transcriptome used to calculate differential expression is incomplete, significant error in the inferred expression levels can result. In this study, we use simulated reads generated from real transcriptomes to determine the accuracy of read mapping, and measure the error resulting from using an incomplete transcriptome. We show that the two primary sources of count- ing error are 1) alternative splice variants that share reads and 2) missing transcripts from the reference. Alternative splice variants increase the false positive rate of mapping while incomplete reference tran- scriptomes decrease the true positive rate, leading to inaccurate transcript expression levels. Grouping transcripts by gene or read sharing (similar to mapping to a reference genome) significantly decreases false positives, but only by improving the reference transcriptome itself can the missing transcript problem be addressed. We also demonstrate that employing different mapping software does not yield substantial increases in accuracy on simulated data. Finally, we show that read lengths or insert sizes must increase past 1kb to resolve mapping ambiguity.
연구 동기 및 목표
- 불완전한 참조 전사체가 RNA-Seq 리드 매핑 정확도와 발현 정량화에 미치는 영향을 평가하기 위해.
- 공유 엑손을 가진 대안 스플라이싱 변이가 매핑 오류와 거짓 양성 비율에 어떤 영향을 미치는지 평가하기 위해.
- 매핑 소프트웨어 선택이나 리드 길이/삽입 크기가 불완전한 전사체에서 매핑 정확도에 영향을 미치는지 평가하기 위해.
- 유전자별 또는 리드 공유 관계에 따라 전사체를 그룹화하면 매핑 오류가 감소하는지 조사하기 위해.
- 더 긴 리드(>1 kb)가 공유 엑손이나 불완전한 기준으로 인한 매핑 모호성을 해결하는 데 어떤 잠재력을 지니는지 평가하기 위해.
제안 방법
- 랜덤 서열(100–5000 bp)을 가진 시뮬레이션 전사체와 다섯 가지 작업(단절, 연장, 삽입, 삭제, 치환)을 사용한 대안 스플라이싱 변이.
- 1%의 무작위 치환 오류와 0x, 10x, 100x, 1000x의 커버리지 수준을 가진 단일 및 쌍방향 리드(100 bp)를 이 전사체에서 생성.
- 기본 설정을 사용하여 Bowtie를 통해 리드를 기준 전사체에 매핑하며, 유일 매핑(-m 1) 및 다중 매핑(-a) 모드를 포함.
- 각 리드의 진짜 전사체 기원을 매핑 소프트웨어가 할당한 전사체와 비교하여 매핑 정확도를 평가(참 양성 대 거짓 양성).
- 실제 및 매핑된 리드 수를 각 전사체별로 비교하여 발현 정확도를 측정하며, 2배 이상의 차이가 나는 경우 오류로 간주.
- Ensembl 관계를 사용하여 전사체를 유전자별로, 다중 매핑 리드 공유를 기반으로 그룹화하여 유전자 수준 및 전사체 가족 수준의 발현 정확도 평가.
실험 결과
연구 질문
- RQ1불완전한 기준 전사체는 RNA-Seq 리드 매핑의 참 양성 비율에 어떤 영향을 미치는가?
- RQ2대안 스플라이싱 변이 간에 공유되는 엑손은 거짓 양성 매핑 비율을 얼마나 증가시키는가?
- RQ3유전자별 또는 리드 공유 관계에 따라 전사체를 그룹화하면 불완전한 전사체에서 매핑 오류를 줄일 수 있는가?
- RQ4다른 매핑 소프트웨어를 사용하면 시뮬레이션된 불완전한 전사체에서 매핑 정확도가 상당히 향상되는가?
- RQ5복잡한 전사체에서 매핑 모호성을 해결하기 위해 필요한 리드 길이 또는 삽입 크기는 얼마인가?
주요 결과
- 불완전한 기준 전사체는 누락된 전사체로 인해 참 양성 매핑 비율을 크게 감소시키며, 이로 인해 전사체 발현이 과소 평가된다.
- 공유 엑손을 가진 대안 스플라이싱 변이는 리드가 여러 전사체에 동일하게 매핑되어 오류 할당이 발생하므로 거짓 양성 비율을 증가시킨다.
- 유전자별 또는 리드 공유 기반의 전사체 그룹화는 거짓 양성을 감소시킬 수 있지만, 누락된 전사체를 완전히 보완할 수는 없다.
- 시뮬레이션 데이터에서 매핑 소프트웨어 선택(Bowtie 등)이 정확도에 상당한 향상을 가져오지 못함을 확인하여, 소프트웨어만으로는 매핑 오류를 해결할 수 없다는 것을 시사한다.
- 공유 엑손이나 불완전한 기준으로 인한 매핑 모호성을 의미 있게 줄이기 위해서는 리드 길이 또는 삽입 크기가 1 kb 이상이어야 한다.
- 정확한 이소프로트 수준의 발현 정량은 여전히 도전 과제이며, 유전자 수준 또는 전사체 가족 수준의 분석이 더 견고하지만 여전히 기준의 완전성에 의해 제한된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.