[논문 리뷰] AI-Aristotle: A Physics-Informed framework for Systems Biology Gray-Box Identification
AI-Aristotle는 eXtreme Theory of Functional Connections (X-TFC), Physics-Informed Neural Networks (PINNs), 그리고 상징적 회귀(SR)을 통합하여 생물학적 시스템에서 정확한 매개변수 추정과 그레이박스 식별을 가능하게 하는 물리학에 통합된 프레임워크이다. 이는 제한된 데이터로부터도 약동학 및 초우주성 내분비 모델에서 누락된 미분방정식 항을 고정밀도로 발견하며, PySR와 같은 강력한 SR 도구를 통해 해석 가능한 상징적 표현을 생성한다.
Discovering mathematical equations that govern physical and biological systems from observed data is a fundamental challenge in scientific research. We present a new physics-informed framework for parameter estimation and missing physics identification (gray-box) in the field of Systems Biology. The proposed framework -- named AI-Aristotle -- combines eXtreme Theory of Functional Connections (X-TFC) domain-decomposition and Physics-Informed Neural Networks (PINNs) with symbolic regression (SR) techniques for parameter discovery and gray-box identification. We test the accuracy, speed, flexibility and robustness of AI-Aristotle based on two benchmark problems in Systems Biology: a pharmacokinetics drug absorption model, and an ultradian endocrine model for glucose-insulin interactions. We compare the two machine learning methods (X-TFC and PINNs), and moreover, we employ two different symbolic regression techniques to cross-verify our results. While the current work focuses on the performance of AI-Aristotle based on synthetic data, it can equally handle noisy experimental data and can even be used for black-box identification in just a few minutes on a laptop. More broadly, our work provides insights into the accuracy, cost, scalability, and robustness of integrating neural networks with symbolic regressors, offering a comprehensive guide for researchers tackling gray-box identification challenges in complex dynamical systems in biomedicine and beyond.
연구 동기 및 목표
- 생물학적 시스템을 지배하는 미분방정식에서 알 수 없는 또는 누락된 항을 데이터 기반 및 물리학에 통합된 방법으로 식별하는 데 도전하는 것.
- 신경망과 상징적 회귀를 통합하여 생물학적 시스템에서 해석 가능성과 모델 정밀도를 향상시키는 통합 프레임워크를 개발하는 것.
- 다양한 데이터 조건 하에서 X-TFC와 PINNs의 매개변수 추정 및 그레이박스 식별 성능을 평가하고 비교하는 것.
- 학습된 신경망 대체모형에서 유의미한 수학적 표현을 추출하는 데 있어 상징적 회귀 도구(PySR 및 gplearn)의 강건성과 효율성을 평가하는 것.
- 의료 및 동역학 시스템에 적용 가능한 확장성 있고 정확하며 계산적으로 효율적인 솔루션을 제공하는 것.
제안 방법
- 프레임워크는 도메인 분할을 통해 정확도를 햖을 X-TFC와 PINNs를 사용하여 미분방정식의 알 수 없는 매개변수와 누락된 항을 추정한다.
- 물리학에 통합된 제약 조건을 사용하여 알려진 미분방정식의 구조를 신경망 학습 과정에 통합함으로써 물리적 일관성을 확보한다.
- 학습된 신경망 대체모형에서 유의미한 닫힌형 수학적 표현을 추출하기 위해 PySR 및 gplearn를 활용한 상징적 회귀를 적용한다.
- 최소제곱 최적화(X-TFC)와 역전파(PINNs)를 조합하여 미분방정식을 해결하며, 데이터 희소성 수준에 따라 성능을 평가한다.
- 정확성, 강건성, 확장성 검증을 위해 약동학 및 초우주성 포도당-인슐린 동역학 두 가지 벤치마크 시스템을 사용한다.
- 결과 일관성과 신뢰성을 확보하기 위해 두 가지 SR 도구를 사용하여 상호 검증을 수행한다.

실험 결과
연구 질문
- RQ1데이터가 희소하거나 풍부할 때 X-TFC와 PINNs의 매개변수 추정 및 그레이박스 식별 성능는 어떻게 비교되는가?
- RQ2PySR 및 gplearn와 같은 상징적 회귀 도구는 생물학적 모델의 신경망 대체모형에서 신뢰성 있게 해석 가능한 수학적 표현을 복원할 수 있는가?
- RQ3데이터셋 크기가 X-TFC와 PINNs의 그레이박스 식별 정확도 및 계산 효율성에 미치는 영향은 무엇인가?
- RQ4다양한 SR 구현 방식과 모델 복잡도에서 발견된 상징적 표현의 강건성은 어떠한가?
- RQ5AI-Aristotle 프레임워크는 실제 의료 응용 분야에서 노이즈가 있는 또는 실험 데이터를 얼마나 잘 처리할 수 있는가?
주요 결과
- 충분한 데이터가 있을 경우 X-TFC는 역전파 대신 최소제곱 최적화를 사용함으로써 PINNs보다 정확도와 계산 효율성에서 뛰어나다.
- 작은 데이터셋에서는 PINNs가 X-TFC보다 더 높은 정확도를 달성하여 데이터가 부족한 상황에서 뛰어난 성능을 보인다.
- PySR는 gplearn보다 속도와 강건성에서 뛰어나며, 하이퍼파rameter 조정이 적고 CPU에서 약 10분 내로 상징적 회귀를 완료하는 데 반해, gplearn는 최대 1시간이 소요된다.
- 약동학 및 초우주성 내분비 모델에 대해 PySR와 gplearn 모두 유사한 표현을 성공적으로 복원하여 결과의 일관성을 확인했다.
- 프레임워크는 미분방정식에서 누락된 항을 높은 정확도로 식별했으며, 유사한 기저 기능 형태와 매우 유사한 상징적 표현을 도출했다.
- AI-Aristotle 프레임워크는 노이즈가 있는 실험 데이터를 처리할 수 있으며, 표준 랩탑에서 몇 분 내로 블랙박스 식별을 수행할 수 있어 실용적인 확장성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.