Skip to main content
QUICK REVIEW

[논문 리뷰] WS4A: a Biomedical Question and Answering System based on public Web Services and Ontologies

Miguel J. Rodrigues, Miguel Falé|arXiv (Cornell University)|2016. 09. 27.
Biomedical Text Mining and Ontologies참고 문헌 13인용 수 4
한 줄 요약

WS4A는 생물의학적 질의에서 개념, 문서, 스니펫, RDF 삼항형, 답변을 추출하기 위해 공공 웹 서비스와 온톨로지를 활용하는 생물의학 질문-답변 시스템이다. BioPortal, UniProt, PubChem, NCBI eutils를 통합함으로써 경쟁적인 성능을 달성하여 두 개의 서브태스크에서 2위를 기록했으며, 서비스 기반, 온톨로지 기반 QA 시스템의 가능성은 입증되었지만, 서비스 가용성 및 튜닝 시간 문제에 직면해 있다.

ABSTRACT

This paper describes our system, dubbed WS4A (Web Services for All), that participated in the fourth edition of the BioASQ challenge (2016). We used WS4A to perform the Question and Answering (QA) task 4b, which consisted on the retrieval of relevant concepts, documents, snippets, RDF triples, exact answers and ideal answers for each given question. The novelty in our approach consists on the maximum exploitation of existing web services in each step of WS4A, such as the annotation of text, and the retrieval of metadata for each annotation. The information retrieved included concept identifiers, ontologies, ancestors, and most importantly, PubMed identifiers. The paper describes the WS4A pipeline and also presents the precision, recall and f-measure values obtained in task 4b. Our system achieved two second places in two subtasks on one of the five batches.

연구 동기 및 목표

  • 기존 공공 웹 서비스와 온톨로지를 최대한 재사용하는 확장성 있고 경량화된 생물의학 질문-답변 시스템을 개발하는 것.
  • BioASQ 2016 챌린지 태스크 4b를 해결하기 위해 관련 개념, 문서, 스니펫, RDF 삼항형, 정확한/최적의 답변을 검색하는 것.
  • 온톨로지를 통한 의미적 강화를 강조하면서, 생물의학 QA에서 서비스 지향 아키텍처의 효과성을 평가하는 것.
  • 기계 학습과 의미 유사도가 개별 개요의 관련성 평가 및 답변 순위 매기기에서 어떤 영향을 미치는지 탐색하는 것.
  • 제한된 튜닝 시간에도 불구하고, 주로 외부 웹 서비스에 기반한 시스템이 경쟁 가능한 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • 온톨로지에 연결된 생물의학적 실체를 식별하기 위해 BioPortal 및 Whatizit 웹 서비스를 사용해 질의와 개요를 텍스트 주석 처리하는 것.
  • 공공 웹 서비스를 통해 주석 처리된 용어를 MeSH, GO, UniProt, Jochem, DO의 개념 식별자로 매핑하는 것.
  • 생물학적 개념과 관련 문헌을 연결하기 위해 PubChem 및 NCBI eutils 서비스를 통해 PubMed ID를 검색하는 것.
  • 의미 유사도와 서포트 벡터 머신을 활용해 개요의 관련성을 평가하고 관련 또는 비관련 문서로 분류하는 것.
  • 링크드 라이프 데이터 SPARQL 엔드포인트를 사용해 순위가 매겨진 개요에서 RDF 삼항형을 생성하여 구조화된 지식 추출을 수행하는 것.
  • 모든 모듈의 결과를 통합하는 파이프라인을 구축하여 답변을 생성하는 것에 중점을 두며, 재사용성과 모ularity를 고려하는 것.

실험 결과

연구 질문

  • RQ1공공 웹 서비스와 온톨로지에 전적으로 의존하는 생물의학 QA 시스템이 경쟁적인 성능을 달성할 수 있는가?
  • RQ2다양한 이질적인 웹 서비스의 통합이 생물의학 분야의 종단 간 질문-답변를 지원하는 데 얼마나 효과적인가?
  • RQ3의미 유사도와 기계 학습이 서비스 기반 아키텍처에서 관련 문서 및 스니펫의 순위 매기기에서 얼마나 향상시킬 수 있는가?
  • RQ4외부 웹 서비스가 간헐적으로 가용성 없이 작동할 경우 시스템 성능은 어떻게 변하는가?
  • RQ5튜닝 시간이 제한된 상황에서 웹 서비스 기반 QA 시스템의 실용적 한계는 무엇인가?

주요 결과

  • WS4A는 BioASQ 2016 챌린지의 첫 번째 배치에서 정확한 답변과 최적의 답변 서브태스크에서 각각 2위를 기록했다.
  • 모든 배치에서의 평균 F-측정치는 낮았으며, 평균 0.24로 검색 단계에서 전반적인 성능가 낮은 편이었다.
  • большин의 배치에서 정밀도와 재현율이 낮았음에도 불구하고, 시스템은 종단 간 생물의학 QA를 위한 공공 웹 서비스 활용 가능성은 입증했다.
  • 평균 응답 시간은 약 90초로 측정되었으며, 느린 또는 가용하지 않은 웹 서비스로 인해 지연이 발생했다.
  • 외부 웹 서비스의 랜덤한 가용성 상실로 인해 결과 생성과 시스템 안정성에 심각한 도전 과제가 발생했다.
  • 늦은 등록으로 인한 튜닝 시간 부족이 이전 년도 성능과 비교해 성능에 상당한 영향을 미쳤다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.