[논문 리뷰] Outcome signature genes in breast cancer: is there a unique set?
이 연구는 유방암에서의 결과 서명 유전자들이 다양한 분석 간에 고유하고 안정적인 집합을 이룬다는지를 조사한다. 단일 데이터셋과 방법을 사용하여, 선택된 유전자 목록이 환자 집단 선택에 매우 민감함을 입증하며, 강한 상관관계 변동성과 생존과 관련된 유전자 상관관계의 미세한 차이로 인해 동일한 데이터에서 여러 개의 동등한 예측 유전자 집합이 도출될 수 있음을 드러낸다.
Motivation: Predicting the metastatic potential of primary malignant tissues has direct bearing on choice of therapy. Several microarray studies yielded gene sets whose expression profiles successfully predicted survival (Ramaswamy et al 2003; Sorlie et al 2001; van't Veer et al 2003). Nevertheless, the overlap between these gene sets is almost zero. Such small overlaps were observed also in other complex diseases (Lossos et al 2003; Miklos and Maleszka 2004), and the variables that could account for the differences had evoked a wide interest. One of the main open questions in this context is whether the disparity can be attributed only to trivial reasons such as different technologies, different patients and different types of analysis. Results: To answer this question we concentrated on one single breast cancer dataset, and analyzed it by one single method, the one which was used by van't Veer et al to produce a set of outcome predictive genes. We showed that in fact the resulting set of genes is not unique; it is strongly influenced by the subset of patients used for gene selection. Many equally predictive lists could have been produced from the same analysis. Three main properties of the data explain this sensitivity: (a) many genes are correlated with survival; (b) the differences between these correlations are small; (c) the correlations fluctuate strongly when measured over different subsets of patients. A possible biological explanation for these properties is discussed.
연구 동기 및 목표
- 유방암에서의 결과 서명 유전자가 생물학적으로 고유한가 아니면 방법론적으로 불안정한가를 규명하는 것.
- 다른 연구들 간의 유전자 집합 차이가 기술적 요인이나 환자 선택과 같은 미세한 요인에서 기인하는가를 조사하는 것.
- 일관된 방법을 사용하여 단일 데이터셋에서의 유전자 선택 안정성을 평가하는 것.
- 예측 가능한 유전자 목록의 비유일성에 기여하는 데이터 특성들을 특정하는 것.
제안 방법
- van't Veer 등이 사용한 동일한 통계적 방법을 단일 유방암 마이크로어레이 데이터셋에 적용하였다.
- 유전자 선택에 사용된 환자 집단을 체계적으로 변화시켜 결과 유전자 목록의 민감도를 평가하였다.
- 다양한 환자 집단에서 개별 유전자 발현 수준과 환자 생존 간 상관관계 강도를 측정하였다.
- 랜덤 및 비랜덤 환자 집단에서 이러한 상관관계의 변동성을 분석하였다.
- 다른 집단에서 유도된 대체 유전자 목록의 예측 능력을 평가하여 성능의 동등성을 테스트하였다.
- 관찰된 유전자 선택의 불안정성에 대한 잠재적 생물학적 설명을 탐색하였다.
실험 결과
연구 질문
- RQ1유방암에서의 결과 서명 유전자 집합은 진정으로 고유한가, 아니면 여러 개의 다른 유전자 목록이 동일한 예측 성능을 낼 수 있는가?
- RQ2동일한 데이터셋에서 생존 예측을 위한 유전자 선택이 환자 집단 선택에 얼마나 의존하는가?
- RQ3일관된 분석 방법을 사용함에도 불구하고 유전자 선택의 높은 변동성에 기여하는 데이터 특성은 무엇인가?
- RQ4공개된 유전자 집합 간의 관찰된 겹침 부족은 생물학적 차이가 아니라 통계적 불안정성 때문일 수 있는가?
- RQ5유전자 발현과 생존 간 상관관계는 충분히 강력하여 안정적이고 재현 가능한 유전자 서명을 도출할 수 있는가?
주요 결과
- 동일한 데이터셋과 분석 방법으로도 환자 생존을 동등하게 예측하는 여러 개의 서로 다른 유전자 목록이 도출되었다.
- 결과 서명 유전자 선택은 분석에 사용된 특정 환자 집단에 매우 민감하게 영향을 받았다.
- 많은 유전자가 생존과 강한 상관관계를 보였지만, 이 상관관계는 집단 간에 변동성이 컸으며, 집단 간 상관관계 값의 미세한 차이가 있었다.
- 유전자 간 상관관계 차이의 크기는 작았지만, 이러한 차이가 충분히 유전자 목록의 선택을 변화시켰다.
- 유전자 선택의 불안정성은 주로 다양한 환자 집단에서 계산된 상관계수 추정치의 높은 분산 때문이었다.
- 이 연구는 공개된 유전자 집합 간 겹침 부족이 생물학적 이질성보다는 방법론적 민감성 때문일 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.