[논문 리뷰] The probability of drawing intersections: extending the hypergeometric distribution
이 논문은 서로 다른 카테고리의 물체를 포함한 다수의 병에서 추출할 때 교차 크기를 모델링하기 위해 초기하분포를 확장한다. 대칭 및 비대칭 케이스에 대한 정확한 확률질량함수를 유도하며, 이중 병 케이스는 고전적인 초기하분포로 축소됨을 보이고, 중복이 있는 특수 케이스에 대해 닫힌 형태의 해를 제공한다. 주요 기여는 다변량 생물학적 데이터에서의 부풀림 검정을 위한 일반적인 프레임워크로, R 패키지 'hint'에 구현되어 있다.
The wide availability of biological data at the genome-scale and across multiple variables has resulted in statistical questions regarding the enrichment or depletion of the number of discrete objects (e.g. genes) identified in individual experiments. Here, I consider the problem of inferring enrichment or depletion when drawing independently, and without replacement, from two or more separate urns in which the same $n$ distinct categories of objects exist. The statistic of interest is the size of the intersection of object categories. I derive a probability mass function describing the distribution of intersection sizes when sampling from N urns and show that this distribution follows the classic hypergeometric distribution when N = 2. I apply the theory to the intersection of genes belonging to a set of traits in three different vertebrate species illustrating that the use of P-values from one-tailed enrichment tests enables accurate clustering of related traits, yet this is not possible when relying on intersection sizes alone. In addition, intersection distributions provide a means to test for co-localization of objects in images when using discretized data, allowing co-localization tests in more than two channels. Finally, I show how to extend the problem to variable numbers of objects belonging to each category, and discuss how to make further progress in this direction. The distribution functions are implemented and freely available in the R package 'hint'.
연구 동기 및 목표
- 다양한 종류의 물체를 포함한 다수의 병에서 추출할 때 교차 크기의 확률 모델을 개발하는 것.
- 두 개 이상의 카테고리와 별개의 병에서 독립적으로 추출하는 것을 다룰 수 있도록 초기하분포를 일반화하는 것.
- 다양한 생물학적 데이터셋(예: 다양한 종 간 겹치는 유전자 집합 등)에서 공통 카테고리의 부풀림 또는 감소를 통계적으로 추론할 수 있도록 하는 것.
- 각 카테고리에 대해 다양한 수의 물체를 포함하며, 병 내에 중복 항목이 포함된 경우를 다룰 수 있도록 프레임워크를 확장하는 것.
- 이산화된 물체 위치를 기반으로 다중 채널 영상 데이터에서의 공위치 분석을 검정하기 위한 계산 도구를 제공하는 것.
제안 방법
- N개의 병에서 각각 n개의 고유한 카테고리가 있는 경우, 유효한 카테고리 조합의 조합 수를 세는 방식으로 교차 크기의 확률질량함수를 유도한다.
- 삼항계수와 조합 항등식을 사용하여 표현식을 단순화하며, 이중 병 및 단일 항목 케이스가 고전적인 초기하분포로 축소됨을 보인다.
- 한 병에 q개의 중복 카테고리가 추가된 비대칭 확장 버전을 도입하여, 닫힌 형태의 해가 없는 복잡한 합으로 이어지지만, 여전히 계산 가능한 형태임을 보인다.
- 모든 n개 카테고리에 중복이 있는 단일 병에서 추출된 고유한 카테고리의 분포에 대해 생성함수와 조합 항등식을 사용하여 닫힌 형태의 표현식을 도출한다.
- 일측 검정 P-값을 사용하여 유도된 분포를 활용해 교차 크기의 통계적 유의성을 검정하며, 생물학적으로 관련된 특성의 군집화를 가능하게 한다.
- 실제 유전체학 및 영상 분석 응용 분야에서 사용할 수 있도록 전체 프레임워크를 오픈소스 R 패키지 'hint'에 구현한다.
실험 결과
연구 질문
- RQ1두 개 이상의 병에서 각각 n개의 고유한 카테고리가 있는 경우, 추출을 복원 없이 수행할 때 교차 크기의 정확한 확률분포는 무엇인가?
- RQ2한 병에 일부 카테고리에서 중복 항목이 존재할 경우, 교차 분포는 어떻게 변화하며, 이를 닫힌 형태로 표현할 수 있는가?
- RQ3유도된 분포를 사용하여 다양한 생물학적 데이터셋(예: 다양한 종 간 겹치는 유전자 집합 등)에서 공통 카테고리의 유의미한 부풀림을 탐지할 수 있는가?
- RQ4모든 카테고리에 중복이 있는 병에서 추출된 고유한 카테고리의 기대값은 표본 크기와 총 카테고리 수에 따라 어떻게 달라지는가?
- RQ5다중 채널 영상에서의 공위치 분석과 같이 두 교차 분포 간의 유의미한 차이를 검정하기 위해 프레임워크를 확장할 수 있는가?
주요 결과
- 각 카테고리에 하나의 물체만 있는 이중 병 케이스에서 교차 분포는 정확히 초기하분포와 일치하며, 고전적인 단일 병 설정 외부에도 적용 가능함을 확인한다.
- 한 병에 q개의 중복 카테고리가 있는 경우, 분포는 닫힌 형태로 표현되지 않지만, 이항계수를 포함한 유한한 합으로 계산 가능하다.
- 모든 n개 카테고리에 중복이 있는 단일 병에서 추출된 고유한 카테고리 수에 대한 닫힌 형태의 표현식을 유도하였다: $ \bb{P}(X=c) = \frac{\binom{n}{c}\binom{c}{a-c}2^{2c-a}}{\binom{2n}{a}} $.
- 모든 카테고리에 중복이 있는 병에서 추출된 고유한 카테고리의 기대값은 $ \bb{E}(X) = a\big(1 - \frac{a-1}{4n-2}\big) $이며, 이는 a와 n보다 작다.
- 부풀림 검정에서의 일측 P-값을 사용하여, 이 방법은 세 종의 척추동물에서 생물학적으로 관련된 특성의 군집화를 성공적으로 수행하였고, 교차 크기만으로는 진정한 관계를 드러내지 못했다.
- 이 프레임워크는 이산화된 공간 채널 간의 물체 교차를 모델링함으로써 다중 채널 영상에서의 공위치 분석을 위한 통계적 검정을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.