Skip to main content
QUICK REVIEW

[논문 리뷰] Clinical Concept Embeddings Learned from Massive Sources of Medical Data.

Andrew L. Beam, Benjamin Kompa|arXiv (Cornell University)|2018. 04. 04.
Biomedical Text Mining and Ontologies인용 수 28
한 줄 요약

이 논문은 6,000만 건의 보험 청구 내역, 2,000만 건의 임상 노트, 170만 건의 생물의학 논문을 융합한 대규모 데이터셋을 기반으로 GloVe와 word2vec 알고리즘을 활용하여 108,477개의 의료 개념에 대한 임베딩을 학습하는 cui2vec 방법을 제안한다. 이 방법은 임상 벤치마크에서 최신 기술 수준의 성능을 달성하며, 공개적으로 사용 가능한 사전 훈련된 임베딩과 상호작용 가능한 도구를 제공한다.

ABSTRACT

Word embeddings have emerged as a popular approach to unsupervised learning of word relationships in machine learning and natural language processing. In this article, we benchmark two of the most popular algorithms, GloVe and word2vec, to assess their suitability for capturing medical relationships in large sources of biomedical data. Leaning on recent theoretical insights, we provide a unified view of these algorithms and demonstrate how different sources of data can be combined to construct the largest ever set of embeddings for 108,477 medical concepts using an insurance claims database of 60 million members, 20 million clinical notes, and 1.7 million full text biomedical journal articles. We evaluate our approach, called cui2vec, on a set of clinically relevant benchmarks and in many instances demonstrate state of the art performance relative to previous results. Finally, we provide a downloadable set of pre-trained embeddings for other researchers to use, as well as an online tool for interactive exploration of the cui2vec embeddings.

연구 동기 및 목표

  • 대규모 생물의학 데이터에서 의료 관계를 효과적으로 포착할 수 있도록 GloVe와 word2vec의 적합성을 평가하기 위해.
  • 다양한 데이터 소스를 융합하여 알려진 바 없는 가장 큰 규모의 임상 개념 임베딩 세트(108,477개의 개념)를 구축하기 위해.
  • clinically 관련된 작업에 대해 cui2vec을 벤치마크화하고 이전 방법들에 비해 뛰어난 성능을 입증하기 위해.
  • 재현 가능성과 더 넓은 연구 활용을 지원하기 위해 사전 훈련된 임베딩과 상호작용 가능한 도구를 공개하기 위해.

제안 방법

  • 저자들은 보험 청구 내역, 임상 노트, 그리고 전체 생물의학 논문을 통합한 코퍼스에 대해 GloVe와 word2vec 알고리즘을 적용한다.
  • 이론적 통찰을 활용하여 두 알고리즘을 통합함으로써 이질적인 데이터 소스 간 일관된 훈련을 가능하게 한다.
  • 임베딩은 임의의 의료 개념 108,477개에 대해 조밀한 벡터 표현을 학습하며, 이는 임상 유니버설 식별자(CUI)로 색인된다.
  • 6,000만 명의 환자, 200만 건의 임상 노트, 170만 건의 저널 논문 데이터가 수집되어 훈련을 위해 사전 처리된다.
  • 스킵그램 및 연속 백오브워즈 아키텍처를 사용하여 엔드 투 엔드로 임베딩을 훈련하며, 음성 샘플링을 통해 최적화된다.
  • 결과적으로 생성된 cui2vec 모델은 임상 벤치마크에서 평가되며, 다운로드 가능한 데이터셋과 상호작용 가능한 시각화 도구와 함께 공개된다.

실험 결과

연구 질문

  • RQ1GloVe와 word2vec은 이질적인 생물의학 데이터 소스에서 의미 있는 의료 개념 표현을 효과적으로 학습할 수 있는가?
  • RQ2청구 내역 데이터, 임상 노트, 전체 논문을 융합함으로써 임상 임베딩의 품질과 커버리지가 어떻게 향상되는가?
  • RQ3cui2vec 모델은 기존 방법들에 비해 임상적으로 관련된 하류 작업에서 뛰어난 성능을 보일 수 있는가?
  • RQ4학습된 임베딩이 임상적으로 관련된 의미적 및 문법적 관계를 어느 정도 잘 포착하는가?

주요 결과

  • cui2vec 모델은 다양한 임상적으로 관련된 벤치마크에서 최신 기술 수준의 성능을 달성하며, 이전의 접근 방식을 능가한다.
  • 청구 내역 데이터, 임상 노트, 전체 논문의 융합은 108,477개의 의료 개념에 대해 임베딩 커버리지와 품질을 크게 향상시킨다.
  • 벤치마크 작업에서 검증된 바에 따르면, 모델은 의료 개념 간 의미적 관계를 강력하게 포착하는 데 성공한다.
  • 사전 훈련된 cui2vec 임베딩는 공개적으로 다운로드 가능하여 다양한 생물의학 NLP 응용 분야에서 재사용이 가능하다.
  • 실시간으로 cui2vec 임베딩 내 의미적 관계를 탐색할 수 있는 상호작용 가능한 온라인 도구가 제공된다.
  • GloVe와 word2vec의 통합 프레임워크는 대규모 이질적인 의료 텍스트 소스 간 일관되고 확장 가능한 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.