Skip to main content
QUICK REVIEW

[논문 리뷰] Combinatorics of pedigrees

Bhalchandra D. Thatte|arXiv (Cornell University)|2006. 09. 10.
Machine Learning and Algorithms참고 문헌 3인용 수 11
한 줄 요약

이 논문은 각 비창시자 정점이 두 부모를 가진 방향 그래프인 피드그리( pedigrees)의 조합론을 조사하며, 재구성과 수량 세기 중점적으로 다룬다. n > 3인 피드그리에 대해 (n−1)개의 현존 정점으로 구성된 부분피드그리를 통한 (n−1)-재구성 가능성에 대한 반례를 포함하는 무한한 가족을 구성함으로써, Steel과 Hein이 제기한 질문에 대해 부정적인 해답을 제시한다. 비이소모르픽 피드그리의 수에 대한 더 엄밀한 하한과 상한을 유도하며, 피드그리 재구성에 필요한 DNA 서열 데이터의 정보 이론적 함의를 제시한다.

ABSTRACT

A pedigree is a directed graph in which each vertex (except the founder vertices) has two parents. The main result in this paper is a construction of an infinite family of counter examples to a reconstruction problem on pedigrees, thus negatively answering a question of Steel and Hein. Some positive reconstruction results are also presented. The problem of counting distinct (mutually non-isomorphic) pedigrees is considered. The known lower and upper bounds on the number of pedigrees are improved upon, and their relevance to pedigree reconstruction from DNA sequence data is discussed. It is shown that the information theoretic bound on the number of segregating sites in the sequence data that is minimally essential for reconstructing pedigrees would not significantly change with improved enumerative estimates.

연구 동기 및 목표

  • Steel과 Hein이 제기한, 피드그리가 r > 2개의 현존 개체로 구성된 부분피드그리로부터 재구성 가능한지 여부에 대한 추측을 해결하기 위해.
  • 고정된 깊이와 순서를 가진 비이소모르픽 피드그리의 수에 대한 하한과 상한을 개선하기 위해.
  • 이러한 한계가 피드그리 재구성에 필요한 DNA 서열 데이터의 정보 이론적 함의에 어떻게 영향을 미치는지 평가하기 위해.
  • 피드그리가 부분피드그리 데이터로부터 유일하게 재구성 가능한지 여부에 영향을 주는 구조적 조건을 조사하기 위해.

제안 방법

  • n−1 = r일 때는 이sovolumetric이지만 서로 이소모르픽이 아닌 무한한 피드그리 가족을 구성함으로써, r = n−1일 때의 재구성 불가능성을 입증한다.
  • 스털링 수의 제1종과 자동형군 크기를 사용하여 비이소모르픽 피드그리의 수를 세기 위한 조합론적 수량 세기 기법을 적용한다.
  • 특수한 부분집합(정점들이 구분 가능한)을 세는 방법을 통해 깊이-d 피드그리의 하한을 도출한다. 이는 트리 구조와 레이블링된 부모 할당을 기반으로 한다.
  • 각 정점의 출력 차수가 2인 완전히 레이블링된 방향 그래프의 수를 세는 방식으로 상한을 확립한다.
  • 정보 이론적 추론을 사용하여 비이소모르픽 피드그리의 수와 피드그리 재구성에 필요한 최소 수의 분리 가능한 DNA 서열 위치 사이의 관계를 규명한다.
  • 하한 구축 시, 현존 정점을 고정하는 비자명한 자동형이 없는 조건 등을 도입하여, 서로 다른 피드그리의 존재를 보장한다.

실험 결과

연구 질문

  • RQ1모든 순서 n > r인 피드그리가 r > 2인 경우에 대해 r-재구성 가능한 정수 r가 존재하는가?
  • RQ2모든 r개 요소로 구성된 현존 정점 부분집합에 대한 부분피드그리로부터 피드그리가 유일하게 재구성 가능한가?
  • RQ3주어진 깊이와 순서를 가진 비이소모르픽 피드그리의 수에 대해 더 엄밀한 한계는 무엇인가?
  • RQ4개선된 수량 세기 한계가 피드그리 재구성에 필요한 분리 가능한 서열 위치의 정보 이론적 하한에 어떻게 영향을 미치는가?
  • RQ5부분피드그리 데이터가 주어졌을 때, 피드그리가 동형에 대해 구분 가능해지도록 하는 구조적 조건은 무엇인가?

주요 결과

  • 모든 n > 3에 대해, (n−1)-재구성 가능하지 않은 순서 n의 피드그리가 존재함을 보이며, 이는 Steel과 Hein이 제기한 문제 2에 대한 부정적 해답을 제공한다.
  • 깊이 d와 순서 n을 가진 비이소모르픽 피드그리의 수에 대한 하한으로 ( (n−1)n^{n−2}/2 )^d 를 도출하였으며, 이는 레이블링된 트리와 부모 할당 수를 세는 방식에서 유도된다.
  • 출력 차수가 2인 완전히 레이블링된 방향 그래프의 수를 세는 방식으로, 이러한 피드그리의 수에 대한 개선된 상한을 도출한다.
  • 일정한 세대 수를 가진 인구집단에서의 피드그리 재구성에 필요한 분리 가능한 서열 위치의 정보 이론적 하한은 약 (d/2)log n 수준이다.
  • 일반적인 피드그리의 경우, 필요한 분리 가능한 서열 위치의 하한은 약 (d/2)log(nd)이며, 수량 세기에서 유도된 상한은 d log n 또는 d log(nd)이다.
  • 부모의 깊이가 정점에서 최대 t+1세대 이내로 제한될 경우, 약 (d/2)log(nt) 수준의 수정된 하한을 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.