Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-source Learning via Completion of Block-wise Overlapping Noisy Matrices

Doudou Zhou, Tianxi Cai|arXiv (Cornell University)|2021. 05. 21.
Advanced Graph Neural Networks참고 문헌 64인용 수 4
한 줄 요약

이 논문은 다중 소스 생물의학 데이터 통합에서 발생하는 블록 구조로 겹치는 노이즈 있는 행렬을 위한 새로운 행렬 완성 방법인 BONMI를 제안한다. 직교 프로크루스터 정렬과 저질서 SVD를 활용하여, 서로 다른 소스 간의 공유 고유공간을 이용해 빈도 높은 블록을 완성함으로써, 비균일하고 블록 구조로 된 누락 정보가 있는 상황에서도 거의 최적의 통계적 속도를 달성한다. 이는 지식 그래프 통합과 다국어 의료 개념 번역 분야에서 뛰어난 경험적 성능을 보인다.

ABSTRACT

Matrix completion has attracted attention in many fields, including statistics, applied mathematics, and electrical engineering. Most of the works focus on the independent sampling models under which the observed entries are sampled independently. Motivated by applications in the integration of knowledge graphs derived from multi-source biomedical data such as those from Electronic Health Records (EHR) and biomedical text, we propose the {\bf B}lock-wise {\bf O}verlapping {\bf N}oisy {\bf M}atrix {\bf I}ntegration (BONMI) to treat blockwise missingness of symmetric matrices representing relatedness between entity pairs. Our idea is to exploit the orthogonal Procrustes problem to align the eigenspace of the two sub-matrices, then complete the missing blocks by the inner product of the two low-rank components. Besides, we prove the statistical rate for the eigenspace of the underlying matrix, which is comparable to the rate under the independently missing assumption. Simulation studies show that the method performs well under a variety of configurations. In the real data analysis, the method is applied to two tasks: (i) the integrating of several point-wise mutual information matrices built by English EHR and Chinese medical text data, and (ii) the machine translation between English and Chinese medical concepts. Our method shows an advantage over existing methods.

연구 동기 및 목표

  • 기존의 행렬 완성 방법이 입자들 간의 독립적이고 균일한 샘플링을 가정하는 데에 한계가 있음을 해결하고자 하며, 이는 실세계의 다중 소스 데이터 통합에서 빈도가 블록 구조로 나타나는 누락 정보에 대해 실패함을 시사한다.
  • 공유되는 그러나 정확히 일치하지 않는 실체나 특징을 가진 소스 간에 대칭 및 비대칭 행렬을 완성하기 위한 통계적으로 타당하고 계산적으로 효율적인 방법을 개발하고자 한다.
  • 블록 구조로 된 누락 정보 하에서 고유공간 추정에 대한 이론적 보장을 제공하며, 독립적 샘플링 하에서의 성능과 비교할 만한 수준의 수렴 속도를 보여주고자 한다.
  • 특히 영어 및 중국어 의료 텍스트와 같은 이질적인 소스에서 온 지식 그래프의 효과적인 통합을 가능하게 하여, 다국어 의료 개념 정렬에 기여하고자 한다.
  • 반복 관측이 필요 없는 비대칭 행렬에 대해서도 프레임워크를 확장하여, 게놈학 및 기타 데이터 통합 작업에 광범위하게 적용 가능하도록 하고자 한다.

제안 방법

  • BONMI는 두 개의 겹치는 데이터 소스에서 유래한 부분 행렬의 고유공간을 직교 프로크루스터 분석을 통해 정렬하여, 일관된 저질서 구조 추정을 가능하게 한다.
  • 정렬된 고유공간에서 유도된 저질서 성분 간의 내적곱을 통해 누락된 블록을 완성하며, 소스 간의 공유된 구조를 활용한다.
  • 완성된 후 집계된 행렬에 대해 특이값 분해(SVD)를 적용하고, 저질서 근사법을 통해 전체 행렬을 복원한다.
  • 비대칭 행렬의 경우 반복 관측이 필요 없이 프레임워크를 확장하며, 겹치는 요소를 고유한 관측으로 간주하는 일반화된 모델을 사용한다.
  • 다수의 소스를 처리하기 위해, 겹치는 쌍들 간의 추정치를 반복적으로 집계하고, 동일한 요소를 여러 소스가 기여할 경우 첫 번째 유효한 추정치를 선택한다.
  • 이론적 분석은 회전 불변 노름을 사용하여 고유공간 추정 오차의 경계를 설정하며, 미약한 조건 하에서 독립적 샘플링과 유사한 수렴 속도를 보여준다.

실험 결과

연구 질문

  • RQ1누락된 항목이 독립적으로 샘플링되지 않고, 일반적으로 다중 소스 생물의학 데이터에서 관찰되는 블록 구조로 나타나는 경우에도 행렬 완성이 효과적으로 수행될 수 있는가?
  • RQ2제안된 BONMI 방법이 블록 구조로 된 누락 정보 하에서도 독립적 샘플링 모델과 비슷한 통계적 성능을 달성할 수 있는가?
  • RQ3BONMI는 영어 및 중국어 의료 텍스트와 같은 여러 소스에서 온 지식 그래프를 성공적으로 통합하여 단어 임베딩 품질을 향상시킬 수 있는가?
  • RQ4기존 방법과 비교해 BONMI는 다국어 의료 개념 번역에서 어떻게 성능을 발휘하는가?
  • RQ5노이즈 있는 관측 하에서 블록 구조로 된 누락 정보가 있는 상황에서 고유공간 추정에 대해 어떤 이론적 보장을 설정할 수 있는가?

주요 결과

  • BONMI는 블록 구조로 된 누락 정보 하에서도 고유공간 추정에 대해 거의 최적의 통계적 오차율을 달성하며, 이는 독립적 샘플링 가정 하에서의 오차 경계와 유사하다.
  • 영어 및 중국어 의료 텍스트에서 유도된 상관관계 행렬의 통합에서 경험적으로 뛰어난 성능을 보이며, 후속 번역 품질 향상에 기여한다.
  • 시뮬레이션 연구를 통해 다양한 설정, 즉 다양한 샘플링 확률과 노이즈 수준에서도 강인함을 확인하였다.
  • 이론적 분석에서 최소 샘플링 확률 $p_0$ 가 0에서 벗어나 있거나 $p_0 = o(1 / \log N)$ 일 경우, 왼쪽 및 오른쪽 특이벡터 추정 오차는 $\frac{\{(1-p_0)K^2 + 1\}K}{\sqrt{\lambda_{\min}}}\sqrt{N}\sigma$ 비례하는 속도로 감소함을 보였다.
  • 희박한 샘플링의 경우 오차 경계에 로그 인자 $p_0 \log N$ 가 포함되어 불확실성이 증가하지만, 여전히 일관성을 유지한다.
  • 반복 관측이 필요 없는 비대칭 행렬로의 확장은 게놈학 데이터 통합과 같이 겹치는 특징가 한 번만 관측되는 상황에서도 적용 범위를 넓혀준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.