Skip to main content
QUICK REVIEW

[논문 리뷰] Applying deep learning techniques on medical corpora from the World Wide Web: a prototypical system and evaluation

José Antonio Miñarro-Giménez, Oscar Marín-Alonso|arXiv (Cornell University)|2015. 02. 12.
Biomedical Text Mining and Ontologies참고 문헌 7인용 수 16
한 줄 요약

이 연구는 웹 기반 의료 텍스트에서 약물 관계를 추출하기 위해 word2vec을 평가하며, NDF-RT 온톨로지가 금표 기준으로 사용된다. 효율적인 벡터 학습에도 불구하고, word2vec은 '치료할 수 있음' 또는 '생리적 영향을 가짐'과 같은 관계를 식별하는 데 49.28%의 정확도에 그쳐, 자동 지식 기반 구축에는 한계가 있음을 시사한다. 다만, 쿠레이션의 시작점으로서 잠재력은 있다.

ABSTRACT

BACKGROUND: The amount of biomedical literature is rapidly growing and it is becoming increasingly difficult to keep manually curated knowledge bases and ontologies up-to-date. In this study we applied the word2vec deep learning toolkit to medical corpora to test its potential for identifying relationships from unstructured text. We evaluated the efficiency of word2vec in identifying properties of pharmaceuticals based on mid-sized, unstructured medical text corpora available on the web. Properties included relationships to diseases ('may treat') or physiological processes ('has physiological effect'). We compared the relationships identified by word2vec with manually curated information from the National Drug File - Reference Terminology (NDF-RT) ontology as a gold standard. RESULTS: Our results revealed a maximum accuracy of 49.28% which suggests a limited ability of word2vec to capture linguistic regularities on the collected medical corpora compared with other published results. We were able to document the influence of different parameter settings on result accuracy and found and unexpected trade-off between ranking quality and accuracy. Pre-processing corpora to reduce syntactic variability proved to be a good strategy for increasing the utility of the trained vector models. CONCLUSIONS: Word2vec is a very efficient implementation for computing vector representations and for its ability to identify relationships in textual data without any prior domain knowledge. We found that the ranking and retrieved results generated by word2vec were not of sufficient quality for automatic population of knowledge bases and ontologies, but could serve as a starting point for further manual curation.

연구 동기 및 목표

  • 비구조화된 웹 텍스트에서 생물의학적 관계를 추출하기 위해 딥러닝, 특히 word2vec을 사용할 수 있는지의 타당성을 평가하기 위해.
  • 실제 중규모 의료 코퍼스에서 word2vec의 성능을 평가하여 약물-질병 및 약물-생리적 영향 관계를 식별하는 데에 사용하기 위해.
  • NDF-RT 온톨로지에서 수작업으로 쿠레이션된 금표 기준 데이터와 비교하여 word2vec이 생성한 관계를 평가하기 위해.
  • 사전처리 및 하이퍼파라미터 튜닝이 모델 정확도 및 랭킹 품질에 미치는 영향을 조사하기 위해.
  • word2vec 출력물이 의료 지식 기반의 자동 쿠레이션을 위한 타당한 기초가 될 수 있는지 판단하기 위해.

제안 방법

  • 저자들은 월드 와이드 웹에서 수집한 비구조화된 의료 텍스트 코퍼스에 word2vec 모델을 적용하였다.
  • 학습된 임베딩 공간 내의 벡터 유사도를 사용하여 '치료할 수 있음' 및 '생리적 영향을 가짐'과 같은 관계를 식별하였다.
  • 예측된 관계를 NDF-RT 온톨로지의 금표 기준과 비교하여 모델 성능을 평가하였다.
  • 구문적 다양성을 줄이기 위한 정규화를 포함한 사전처리 전략을 적용하여 모델의 유용성을 향상시켰다.
  • 벡터 크기, 윈도우 크기, 학습률 등의 하이퍼파라미터를 체계적으로 변경하여 정확도 및 랭킹에 미치는 영향을 평가하였다.
  • 코사인 유사도 기반 접근 방식을 사용하여 관련 약물-어휘 쌍을 검색하였으며, 결과는 정밀도 평가를 위해 랭킹 처리되었다.

실험 결과

연구 질문

  • RQ1word2vec은 비구조화된 의료 웹 텍스트에서 약물-질병 및 약물-생리적 영향 관계를 효과적으로 식별할 수 있는가?
  • RQ2word2vec 프레임워크에서 다양한 하이퍼파라미터 설정에 따라 모델 정확도는 어떻게 변하는가?
  • RQ3구문적 사전처리가 학습된 벡터 표현 품질 및 후속 관계 추출에 어떤 영향을 미치는가?
  • RQ4word2vec 기반의 관계 검색에서 랭킹 품질과 정확도 사이에 트레이드오프가 존재하는가?
  • RQ5word2vec 출력물은 의료 지식 기반 및 온톨로지의 자동 구축에 어느 정도 기여할 수 있는가?

주요 결과

  • word2vec이 약물 관계를 식별하는 데 도달한 최대 정확도는 49.28%였으며, 이는 이 작업에 대해 제한된 효과성을 시사한다.
  • 정확도와 랭킹 품질 사이에 뚜렷한 트레이드오프가 관찰되었으며, 높은 순위의 결과가 반드시 더 정확한 것은 아니었다.
  • 구문적 다양성을 줄이기 위해 코퍼스를 사전처리하는 것은 학습된 벡터 모델의 유용성을 크게 향상시켰다.
  • 결과적으로 word2vec만으로는 의료 지식 기반의 신뢰할 수 있는 자동 쿠레이션에 부적합하다는 것이 확인되었다.
  • 낮은 정확도에도 불구하고, word2vec는 사전 도메인 지식 없이도 효율적인 벡터 표현을 생성하는 데 유용한 도구이다.
  • 이 연구는 word2vec 출력물이 후속 수작업 쿠레이션 작업의 유용한 시작점이 될 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.