Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Medical Documents Classification Based on MesH Domain Ontology

Zakaria Elberrichi, Malika Taibi|arXiv (Cornell University)|2012. 06. 21.
Text and Document Classification Technologies참고 문헌 6인용 수 9
한 줄 요약

이 논문은 MeSH 도메인 온톨로지 기반으로 다국어 의료 문서 분류 시스템을 제안하며, 개념 기반 문서 표현과 두 가지 다른 접근 방식을 활용한다: 하나는 온톨로지를 단일 언어로 간주하는 방식이고, 다른 하나는 다국어 온톨로지로 간주하는 방식이다. 언어 식별 후 다국어 용어를 영문 MeSH 개념으로 매핑함으로써, Ohsumed 코퍼스에서 유의미한 분류 성능를 달성하여 생물의학 분야에서 온톨로지 기반 의미 분류가 다국어 간 가능하다는 것을 입증한다.

ABSTRACT

This article deals with the semantic Web and ontologies. It addresses the issue of the classification of multilingual Web documents, based on domain ontology. The objective is being able, using a model, to classify documents in different languages. We will try to solve this problematic using two different approaches. The two approaches will have two elementary stages: the creation of the model using machine learning algorithms on a labeled corpus, then the classification of documents after detecting their languages and mapping their terms into the concepts of the language of reference (English). But each one will deal with the multilingualism with a different approach. One supposes the ontology is monolingual, whereas the other considers it multilingual. To show the feasibility and the importance of our work, we implemented it on a domain that attracts nowadays a lot of attention from the data mining community: the biomedical domain. The selected documents are from the biomedical benchmark corpus Ohsumed, and the associated ontology is the thesaurus MeSH (Medical Subject Headings). The main idea in our work is a new document representation, the masterpiece of all good classification, based on concept. The experimental results show that the recommended ideas are promising.

연구 동기 및 목표

  • 의료 생물학적 문서의 다국어 분류 문제를 의미 온톨로지 기반으로 해결하고자 한다.
  • 다국어 처리를 위한 두 가지 다른 접근 방식을 탐색한다: 단일 언어 온톨로지에 대한 다국어 용어 매핑과 다국어 온톨로지 통합.
  • MeSH를 사용하여 키워드 기반 표현 대신 개념 수준 표현을 도입함으로써 문서 분류 정확도를 향상시키고자 한다.
  • 실제 생물의학 기준 코퍼스(Ohsumed)와 표준 온톨로지(MeSH)를 사용하여 접근 방식을 검증하고자 한다.
  • 다국어 의료 정보 검색에서 온톨로지 기반 의미 분류의 실현 가능성과 효율성을 입증하고자 한다.

제안 방법

  • 각 문서의 언어를 식별하기 위해 언어 식별을 먼저 수행한다.
  • 다국어 문서의 용어들을 기준 언어인 영문 MeSH 개념에 매핑한다.
  • 용어를 해당 MeSH 개념으로 대체함으로써 개념 기반 문서 표현을 구성한다.
  • 레이블이 부여된 코퍼스를 사용하여 개념 표현된 문서를 기반으로 기계 학습 모델을 훈련시킨다.
  • 두 가지 접근 방식을 구현한다: 단일 언어 MeSH 온톨로지에 기반한 다국어 용어 매핑 방식과 다국어 MeSH 버전을 사용하는 방식.
  • 개념 통합된 문서 벡터를 기반으로 표준 학습 알고리즘을 사용하여 분류를 수행한다.

실험 결과

연구 질문

  • RQ1영문을 기준 언어로 하는 단일 온톨로지(영문 MeSH)를 사용하여 다국어 의료 문서를 용어-개념 매핑을 통해 효과적으로 분류할 수 있는가?
  • RQ2다국어 MeSH 온톨로지를 사용할 경우 단일 언어 온톨로지 대비 분류 성능에서 어떤 차이가 있는가?
  • RQ3다국어 생물의학 환경에서 기존 키워드 기반 방법에 비해 개념 기반 문서 표현이 분류 정확도 향상에 얼마나 기여하는가?
  • RQ4제안된 방법은 실제 다국어 생물의학 문서 컬렉션에 대해 확장 가능하고 실현 가능한가?

주요 결과

  • 개념 기반 표현 방식은 기존 키워드 기반 방법에 비해 문서 분류 성능을 크게 향상시킨다.
  • 단일 언어 MeSH 온톨로지에 기반한 다국어 용어 매핑을 사용한 접근 방식은 Ohsumed 코퍼스에서 뛰어난 분류 성능를 달성한다.
  • 표준화된 온톨로지에 대한 의미적 정렬을 통해 다국어 생물의학 문서를 처리하는 데의 실현 가능성을 입증한다.
  • 실험 결과는 온톨로지 기반 의미 표현이 다국어 의료 문서 분류에 있어 유망한 접근 방식임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.