[논문 리뷰] Integration of knowledge and data in machine learning
이 논문은 지식 발견과 지식 임베딩을 데이터 기반 ML과 어떻게 통합할 수 있는지 조사하고, 방법, 격차, 기회를 개요하며 발견과 임베딩 간의 폐쇄 루프를 주장한다.
Scientific research's mandate is to comprehend and explore the world, as well as to improve it based on experience and knowledge. Knowledge embedding and knowledge discovery are two significant methods of integrating knowledge and data. Through knowledge embedding, the barriers between knowledge and data can be eliminated, and machine learning models with physical common sense can be established. Meanwhile, humans' understanding of the world is always limited, and knowledge discovery takes advantage of machine learning to extract new knowledge from observations. Knowledge discovery can not only assist researchers to better grasp the nature of physics, but it can also support them in conducting knowledge embedding research. A closed loop of knowledge generation and usage are formed by combining knowledge embedding with knowledge discovery, which can improve the robustness and accuracy of models and uncover previously unknown scientific principles. This study summarizes and analyzes extant literature, as well as identifies research gaps and future opportunities.
연구 동기 및 목표
- 지식 발견과 지식 임베딩 간의 구분 및 상호작용을 명확히 한다.
- 데이터로부터 제약 방정식(구조 및 계수)을 발견하는 기존 방법을 요약한다.
- 도메인 지식을 ML 모델에 통합하는 지식 임베딩 기법을 요약한다.
- 지식-데이터 학습의 통합을 진전시키기 위한 연구 격차와 기회를 식별한다.
제안 방법
- 지식 발견 방법을 폐쇄형 라이브러리, 확장 가능한 라이브러리, 개방 형태 접근 방식으로 분류한다.
- 희소 회귀, 유전 알고리즘, 기호 회귀, PDE-Net 변형을 포함하여 복잡한 구조와 계수를 가진 방정식 채굴 접근법을 논의한다.
- 데이터 전처리, 모델 구조 설계, 제약/보상(소프트 제약 대 하드 제약)에서의 지식 임베딩 전략을 설명한다.
- 소프트 제약과 하드 제약 프레임워크의 비교 및 데이터 효율성 및 물리적 충실도에 미치는 영향을 논의한다.
- PINN, TgNN, PgNN 및 물리 제약 손실 형태와 같은 실용적 임베딩 기법을 강조한다.
실험 결과
연구 질문
- RQ1데이터로부터 제어 방정식을 추출하기 위한 지식 발견 방법의 주요 범주와 능력은 무엇인가?
- RQ2도메인 지식을 ML 모델에 임베딩하여 정확도, 강건성, 물리적 일관성을 어떻게 향상시킬 수 있는가?
- RQ3ML에서 지식(발견 및 임베딩)과 데이터의 통합을 제한하는 주요 과제는 무엇이며, 이를 해결할 향후 방향은 무엇인가?
- RQ4방정식 채굴에서 계수(상수, 표현 가능, 표현 불가)의 역할은 무엇이며 이를 효과적으로 추정하려면 어떻게 해야 하는가?
- RQ5지식 발견과 지식 임베딩 간의 폐쇄 루프를 어떻게 실현하여 과학 및 공학 작업을 발전시킬 수 있는가?
주요 결과
- 지식 발견 방법은 방정식의 표현 방식(폐쇄형 라이브러리, 확장 가능한 라이브러리, 개방 형식)과 계수의 복잡성에 따라 다르다.
- 개방 형식의 방법은 복잡한 구조에 대해 더 큰 유연성을 제공하지만 계산 비용이 더 높다.
- 지식 임베딩은 데이터 전처리, 네트워크 설계, 제약 최적화를 통해 구현될 수 있으며, 소프트 제약 대 하드 제약은 데이터 필요성과 충실도에 영향을 준다.
- 하드 제약은 데이터 요구를 줄일 수 있지만 올바른 도메인 지식에 의존하며, 소프트 제약은 구현이 더 쉽지만 물리 법칙을 정확히 강제하지 않을 수 있다.
- 저자는 지식 발견에서의 다섯 가지 격차/기회(그라디언트에 적합한 임베딩, 필요조건 추출, 복잡 구조/계수 채굴, 그래디언트 정확도, 방정식 단순화)와 지식 임베딩에서의 다섯 가지 격차/기회(복잡한 지배 방정식 처리, 그래프 네트를 통한 불규칙한 필드, 적응형 하이퍼파라미터, 시끄럽고 희소한 데이터, 접근성 향상을 위한 자동 ML) 를 지적한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.