Skip to main content
QUICK REVIEW

[논문 리뷰] Data-driven Discovery of Chemotactic Migration of Bacteria via Machine Learning

Yorgos M. Psarellis, Seung‐Joon Lee|arXiv (Cornell University)|2022. 08. 25.
Cell Image Analysis Techniques인용 수 7
한 줄 요약

이 논문은 E. coli 이동의 희박하고 노이즈가 많거나 부분적인 실험 및 시뮬레이션 데이터로부터 미분방정식(PDE)의 화학성향성을 발견하기 위한 기계학습 프레임워크를 제안한다. 박테리아 밀도 변화의 저차원 역학을 활용하여, 이 방법은 정확하게 박테리아 파동 전파를 예측하고 측정되지 않은 화학유인물질 필드를 추정하는 데이터 기반 PDE를 학습한다. 이는 시간적·공간적 해상도가 낮은 데이터에서도 성공을 보여준다.

ABSTRACT

E. coli chemotactic motion in the presence of a chemoattractant field has been extensively studied using wet laboratory experiments, stochastic computational models as well as partial differential equation-based models (PDEs). The most challenging step in bridging these approaches, is establishing a closed form of the so-called chemotactic term, which describes how bacteria bias their motion up chemonutrient concentration gradients, as a result of a cascade of biochemical processes. Data-driven models can be used to learn the entire evolution operator of the chemotactic PDEs (black box models), or, in a more targeted fashion, to learn just the chemotactic term (gray box models). In this work, data-driven Machine Learning approaches for learning the underlying model PDEs are (a) validated through the use of simulation data from established continuum models and (b) used to infer chemotactic PDEs from experimental data. Even when the data at hand are sparse (coarse in space and/or time), noisy (due to inherent stochasticity in measurements) or partial (e.g. lack of measurements of the associated chemoattractant field), we can attempt to learn the right-hand-side of a closed PDE for an evolving bacterial density. In fact we show that data-driven PDEs including a short history of the bacterial density field (e.g. in the form of higher-order in time PDEs in terms of the measurable bacterial density) can be successful in predicting further bacterial density evolution, and even possibly recovering estimates of the unmeasured chemonutrient field. The main tool in this effort is the effective low-dimensionality of the dynamics (in the spirit of the Whitney and Takens embedding theorems). The resulting data-driven PDE can then be simulated to reproduce/predict computational or experimental bacterial density profile data, and estimate the underlying (unmeasured) chemonutrient field evolution.

연구 동기 및 목표

  • 화학성향 항목이 해석적으로 다루기 어려운 경우에도 박테리아 화학성향을 지배하는 매크로스코픽 PDE를 발견하기 위한 데이터 기반 기계학습 접근법을 개발하는 것.
  • 기존의 확장된 Keller-Segel 모델에서 알려진 매개변수와 역학을 가진 시뮬레이션 데이터를 바탕으로 방법을 검증하는 것.
  • 공간적·시간적 해상도가 낮고 측정이 제한되며 측정되지 않은 화학유인물질 필드가 존재하는 실제 실험 데이터에 프레임워크를 적용하는 것.
  • 단지 박테리아 밀도의 짧은 시간 역사만을 사용하여 박테리아 밀도 변화를 예측하고 측정되지 않은 화학유인물질 필드를 추정할 수 있도록 하는 것.
  • 낮은 데이터 양과 노이즈 상황에서도 임베딩 정리들을 활용해 저차원 역학을 활용함으로써 의미 있는 PDE의 구조를 회복할 수 있음을 입증하는 것.

제안 방법

  • 이 방법은 박테리아 밀도 변화를 지배하는 PDE의 우변을 학습하기 위해 딥 피드포워드 신경망을 사용하며, 화학성향 항목을 블랙박스 또는 회색박스 함수로 간주한다.
  • 모델은 공간-시간적 박테리아 밀도 데이터로 훈련되며, 사전처리로 공간 스무딩(Savitzky-Golay 및 가우시안 필터)과 시간 보간(Gaussian 라디얼 기저 함수를 사용)이 수행된다.
  • 학습을 안정화하고 노이즈에 강건하게 하기 위해, 밀도장의 시간 도함수에 특이값 분해(SVD) 필터링을 적용하여 주요 특이벡터(8개, 총 분산의 99% 이상)만 유지한다.
  • 훈련된 신경망은 시간에 따라 전진적으로 통합되는 데이터 기반 PDE를 정의하며, 자동 미분를 통해 야코비안을 계산하는 BDF 통합기법을 사용한다.
  • 이 접근법은 Whitney 및 Takens 임베딩 정리에 영감을 받아, 제한된 관측으로부터도 저차원 역학을 활용해 동역학을 재구성한다.
  • 프레임워크는 알려진 PDE 모델에서 유도된 시뮬레이션 데이터와 E. coli의 다공성 매질 내 화학성향에 대한 실제 실험 데이터에 모두 적용된다.

실험 결과

연구 질문

  • RQ1기계학습 모델은 희박하고 노이즈가 많은 실험 데이터로부터 박테리아 화학성향을 지배하는 기저 PDE를 정확하게 발견할 수 있는가?
  • RQ2박테리아 밀도의 부분적 또는 굵은 해상도의 측정값만 있을 경우 데이터 기반 PDE는 박테리아 밀도 변화를 얼마나 잘 예측할 수 있는가?
  • RQ3관측된 박테리아 밀도 동역학만으로 측정되지 않은 화학유인물질 필드의 추정치를 회복할 수 있는가?
  • RQ4박테리아 밀도장의 짧은 역사 정보를 통합할 경우 데이터 부족 상황에서 예측 정확도가 얼마나 향상되는가?
  • RQ5모의 데이터에서부터 측정 노이즈가 크고 해상도가 낮은 실제 실험 데이터로의 일반화가 가능한가?

주요 결과

  • 데이터 기반 PDE 모델은 시뮬레이션 및 실험 데이터 모두에서 박테리아 파동 전파를 성공적으로 예측한다. 이는 공간 해상도가 낮은 경우(2.48 μm)와 낮은 시간 샘플링(10분 간격)에도 해당된다.
  • 이 방법은 시간이 지남에 따라 박테리아 밀도 변화의 역학을 정확히 재구성하며, 훈련 기간 이후 90초 간의 유효성 검증이 가능하다.
  • 시간 도함수에 SVD 필터링을 적용함으로써 모델은 노이즈에 강건해지고 과적합을 방지하며, 총 분산의 99% 이상을 설명하는 주요 8개의 특이벡터만 유지한다.
  • 학습된 PDE의 구조와 시스템의 저차원 역학을 활용하여 측정되지 않은 화학유인물질 필드의 변화를 추정할 수 있다.
  • 모의 데이터(알려진 매개변수를 가진)에서부터 실제 실험 데이터로의 일반화 성능이 뛰어나, 데이터 기반 PDE가 복잡한 생물학적 시스템에 대해 정확한 서rogate 모델이 될 수 있음을 보여준다.
  • 밀도장의 짧은 역사 정보를 활용한 고차원 시간 정보의 사용은 데이터가 희박한 상황에서도 성공적인 예측을 가능하게 하며, 생물학적 시스템에서 임베딩 원리의 타당성을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.