Skip to main content
QUICK REVIEW

[논문 리뷰] Similarities and Differences between Machine Learning and Traditional Advanced Statistical Modeling in Healthcare Analytics

Michele Bennett, Karin Hayes|arXiv (Cornell University)|2022. 01. 07.
Artificial Intelligence in Healthcare인용 수 14
한 줄 요약

이 논문은 의료 분석 분야에서 기계학습(ML)과 전통적인 고급 통계 모델링을 비교하며, 두 접근 방식은 상호 대체 관계가 아니라 상호 보완적임을 주장한다. 두 접근 방식이 기초 수학 원리에서 공통점을 가지지만 도구, 가정, 적용 사례에서 차이를 보이며, 최적의 선택은 데이터 특성, 문제 목표(예측 vs. 인과관계), 그리고 표본 크기 및 변수 수와 같은 실증적 제약 조건에 따라 달라진다.

ABSTRACT

Data scientists and statisticians are often at odds when determining the best approach, machine learning or statistical modeling, to solve an analytics challenge. However, machine learning and statistical modeling are more cousins than adversaries on different sides of an analysis battleground. Choosing between the two approaches or in some cases using both is based on the problem to be solved and outcomes required as well as the data available for use and circumstances of the analysis. Machine learning and statistical modeling are complementary, based on similar mathematical principles, but simply using different tools in an overall analytics knowledge base. Determining the predominant approach should be based on the problem to be solved as well as empirical evidence, such as size and completeness of the data, number of variables, assumptions or lack thereof, and expected outcomes such as predictions or causality. Good analysts and data scientists should be well versed in both techniques and their proper application, thereby using the right tool for the right project to achieve the desired results.

연구 동기 및 목표

  • 의료 분석에서 기계학습을 전통적 통계 모델링과 대립시켜 오해하는 것을 명확히 하기 위해.
  • 기계학습과 통계 모델링 간의 핵심 유사점과 차이점을 수학적 기초와 실용적 적용 측면에서 규명하기 위해.
  • 데이터 품질, 문제 유형, 예측 또는 인과 추론과 같은 목표에 따라 데이터 과학자와 연구자가 적절한 방법을 선택할 수 있도록 안내하기 위해.
  • 분석적 맥락에 따라 기계학습과 통계 모델링을 전략적으로 활용하는 하이브리드 접근 방식을 주장하기 위해.
  • 최적의 결과를 얻기 위해 두 방법론을 모두 숙련해야 한다는 점을 강조함으로써 다학제적 전문성을 촉진하기 위해.

제안 방법

  • 저자들은 의료 데이터 과학에서 유래한 개념적 및 실용적 프레임워크를 활용하여 기계학습과 통계 모델링 간의 비교 분석을 수행한다.
  • 최적화 및 확률 이론과 같은 공통된 수학 원리를 평가하여 두 접근 방식의 기초적 유사성을 입증한다.
  • 실제 의료 분석 사례를 사용하여 기계학습(예: 신경망, 랜덤 포레스트)과 전통적 모델(예: 코ックス 회귀, 일반화선형모형)의 사용을 대비한다.
  • 표본 크기, 완전성, 변수 수, 가정(파라미터형 대비 비파라미터형) 등의 기준을 통해 방법론적 상충 요소를 평가한다.
  • 예측 정확도 대비 인과 해석과 같은 문제 목표를 데이터 가용성 및 품질과 비교하여 결정 프레임워크를 적용한다.
  • 구분과 상호보완성을 명확히 하기 위해 예시와 개념도(그림 2개)를 포함한 분석을 수행한다.

실험 결과

연구 질문

  • RQ1기계학습과 전통적 통계 모델링은 수학적 기초와 핵심 원리 측면에서 어떻게 비교될 수 있는가?
  • RQ2어떤 의료 분석 상황에서 기계학습이 전통적 통계 모델링보다 더 적합한가, 반대로 어떤 경우에 전통적 모델링이 더 적합한가?
  • RQ3표본 크기, 완전성, 변수 수와 같은 데이터 특성이 기계학습과 통계 모델링 간의 선택에 어떤 영향을 미치는가?
  • RQ4기계학습과 통계 모델링을 함께 사용할 수 있는 정도는 얼마나 높으며, 이를 통해 의료 분석 결과를 어떻게 향상시킬 수 있는가?
  • RQ5예측과 인과 추론이라는 목적이 기계학습과 통계 모델링 간의 선택에 어떻게 영향을 미치는가?

주요 결과

  • 기계학습과 전통적 통계 모델링은 근본적으로 상호 보완적이며, 최적화 및 확률 이론과 같은 핵심 수학 원리를 공유하지만, 대립적인 접근 방식은 아니다.
  • 기계학습과 통계 모델링 간의 선택은 데이터 가용성, 크기, 완전성, 그리고 목표 결과(예측 vs. 인과관계)와 같은 구체적 문제 맥락에 따라 결정되어야 한다.
  • 통계 모델은 일반적으로 더 해석 가능하며, 특히 작은 크기이거나 더 구조화된 데이터 세트에서는 인과 추론에 더 적합하다.
  • 충분한 데이터가 확보된 경우 기계학습은 고차원 데이터 환경과 복잡한 패턴 인식에서 뛰어난 성능을 발휘한다.
  • 두 접근 방식 모두 숙련된 전문가의 적용을 통해 최적의 효과를 얻을 수 있다: 숙련된 실무자는 각각의 분석 과제에 가장 적합한 도구를 선택하기 위해 두 방법론에 능숙해야 한다.
  • 논문은 가장 효과적인 분석 전략은 실증적 증거와 문제 특성에 기반하여 기계학습과 통계 모델링을 통합하는 데 있음을 결론으로 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.