[논문 리뷰] Progressive Mauve: Multiple alignment of genomes with gene flux and rearrangement
Progressive Mauve는 새로운 다중 게놈 정렬 방법을 도입하여 유전자 유동, 재배열 및 인ser션/딜리션 사건이 광범위하게 발생한 게놈을 정확하게 정렬한다. 이는 합계-쌍 브레이크포인트 스코어와 확률적 필터링을 사용한다. 23개의 엔테로박테리아 게놈을 정렬함으로써 이전 방법보다 뛰어난 정확도를 달성하였으며, 조절 다형성과 연관된 광범위한 비암호화 영역 변이를 드러내었고, 코어 게놈 2.46 Mbp와 펜 게놈 15.2 Mbp를 규명하였다.
Multiple genome alignment remains a challenging problem. Effects of recombination including rearrangement, segmental duplication, gain, and loss can create a mosaic pattern of homology even among closely related organisms. We describe a method to align two or more genomes that have undergone large-scale recombination, particularly genomes that have undergone substantial amounts of gene gain and loss (gene flux). The method utilizes a novel alignment objective score, referred to as a sum-of-pairs breakpoint score. We also apply a probabilistic alignment filtering method to remove erroneous alignments of unrelated sequences, which are commonly observed in other genome alignment methods. We describe new metrics for quantifying genome alignment accuracy which measure the quality of rearrangement breakpoint predictions and indel predictions. The progressive genome alignment algorithm demonstrates markedly improved accuracy over previous approaches in situations where genomes have undergone realistic amounts of genome rearrangement, gene gain, loss, and duplication. We apply the progressive genome alignment algorithm to a set of 23 completely sequenced genomes from the genera Escherichia, Shigella, and Salmonella. The 23 enterobacteria have an estimated 2.46Mbp of genomic content conserved among all taxa and total unique content of 15.2Mbp. We document substantial population-level variability among these organisms driven by homologous recombination, gene gain, and gene loss. Free, open-source software implementing the described genome alignment approach is available from http://gel.ahabs.wisc.edu/mauve .
연구 동기 및 목표
- 광범위한 유전자 증가, 손실, 중복 및 재배열이 발생하는 상황에서 정확한 다중 게놈 정렬을 해결하기 위해.
- 재조합과 유전자 유동이 일어나는 게놈에서 동일유전자, 크로스오버 유전자 및 관련 없는 서열을 구분할 수 있는 방법을 개발하기 위해.
- 새로운 스코어 함수를 통해 신테니 맵핑과 정렬을 통합하여 정렬 정확도를 향상시키기 위해.
- 브레이크포인트 및 인델 예측 정확도를 측정하는 지표를 사용하여 정렬 품질을 정량화하기 위해.
- 다양한 미생물 양식 간 신뢰할 수 있는 전장 정렬을 제공함으로써 비교 게놈학 및 인구 게놈학 연구를 가능하게 하기 위해.
제안 방법
- 이 방법은 정렬 구성이 재배열이나 반복 영역에 고정되는 것을 방지하기 위해 새로운 합계-쌍 브레이크포인트 스코어를 사용한다.
- 일관된 기반으로 한 단일 참조 게놈에 의존하지 않고, 종군의 일부 서브셋 간에 공통 영역을 정렬하는 점진적 정렬 전략을 사용한다.
- 오류 정렬을 제거하여 특이도를 향상시키기 위해 오류 없는 관련 없는 서열 정렬을 제거하는 확률적 필터링 단계를 사용한다.
- 심테니 맵핑과 정렬을 하나의 프레임워크에 통합하여 앵커 배치와 정렬 간 상호 보완적 개선을 가능하게 한다.
- 계산 효율성을 향상시키면서 민감도를 유지하기 위해 밴드 스코어를 적용한 동적 프로그래밍 기반 정렬을 적용한다.
- 자바 기반 상호작용 시각화를 통해 다양한 게놈 간 공통 및 변동 영역 탐색을 가능하게 한다.
실험 결과
연구 질문
- RQ1유전자 유동과 재배열이 광범위하게 발생한 상황에서 어떻게 다중 게놈 정렬을 정확하게 수행할 수 있는가?
- RQ2근연한 박테리아 종에서 재조합, 유전자 증가 및 손실로 인해 비암호화 영역이 얼마나 변동성이 있는가?
- RQ3복잡한 진화적 사건이 존재하는 상황에서 통합 정렬 프레임워크가 동일유전자, 크로스오버 유전자 및 비동일 유전자 서열을 어떻게 구분할 수 있는가?
- RQ4엔테로박테리아세이의 가족 내에서 코어 게놈과 펜 게놈의 다양성, 특히 비암호화 조절 영역까지 포함하여 얼마나 넓은가?
- RQ5재조합이 비암호화 영역의 보존 패턴에 어떻게 영향을 미치며, 이는 조절 다형성에 대해 어떤 함의를 갖는가?
주요 결과
- Progressive Mauve 알고리즘은 현실적인 유전자 유동과 재배열을 가진 시뮬레이션 데이터셋에서 이전 방법보다 유의미하게 높은 정렬 정확도를 달성하였다.
- 이 방법은 에시히리키아, 셰이그렐라, 살름넬라 속의 23개 완전 게놈을 성공적으로 정렬하여 코어 게놈 2.46 Mbp와 펜 게놈 15.2 Mbp를 규명하였다.
- 대규모 인구 수준의 변동성이 관찰되었으며, 변동의 대부분이 비암호화 영역에 집중되어 있어 조절 다형성과 관련이 있음을 시사하였다.
- 특정 균주에서 비표준적 대체가 일어난 RIP 요소를 포함하여, yhjE 루크스 영역에서 비암호화 서열의 고도로 변동성이 높은 것으로 나타났다.
- RIP 요소 영역에서의 비암호화 변동의 계통수 패턴은 수직 유전보다 재조합에 의한 다형성임을 시사하며, 일부 E. coli 및 셰이그렐라 균주 군에서 수렴적 진화의 증거를 보였다.
- 23개 게놈 정렬의 스크리닝을 통해 102개의 엄격한 비암호화 영역을 식별하였으며, 이들은 유사한 변동 패턴을 보였고, 비암호화 영역 내 광범위한 조절 잠재성을 강조하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.