Skip to main content
QUICK REVIEW

[논문 리뷰] Assessment of contextualised representations in detecting outcome phrases in clinical trials

Micheal Abaho, Danushka Bollegala|arXiv (Cornell University)|2022. 02. 13.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 임상적으로 표준화된 결과 어휘를 가진 300개의 무작위 대조 시험(RCT) 초록으로 구성된 새로운 전문가 주석 처리 데이터셋인 EBM-COMET을 소개하고, 특히 미세조정된 BioBERT를 포함한 문맥 기반 표현을 사용하여 전체 결과 어휘를 탐지하는 성능을 평가한다. 최고의 모델은 81.5%의 F1 점수를 기록하여 EBM-NLP에서 이전 최고 성능(SOTA)을 초월하며, 엄격한 전체 어휘 탐지 작업에 대해 미세조정된 도메인 전용 모델의 우수성을 입증한다.

ABSTRACT

Automating the recognition of outcomes reported in clinical trials using machine learning has a huge potential of speeding up access to evidence necessary in healthcare decision-making. Prior research has however acknowledged inadequate training corpora as a challenge for the Outcome detection (OD) task. Additionally, several contextualized representations like BERT and ELMO have achieved unparalleled success in detecting various diseases, genes, proteins, and chemicals, however, the same cannot be emphatically stated for outcomes, because these models have been relatively under-tested and studied for the OD task. We introduce "EBM-COMET", a dataset in which 300 PubMed abstracts are expertly annotated for clinical outcomes. Unlike prior related datasets that use arbitrary outcome classifications, we use labels from a taxonomy recently published to standardize outcome classifications. To extract outcomes, we fine-tune a variety of pre-trained contextualized representations, additionally, we use frozen contextualized and context-independent representations in our custom neural model augmented with clinically informed Part-Of-Speech embeddings and a cost-sensitive loss function. We adopt strict evaluation for the trained models by rewarding them for correctly identifying full outcome phrases rather than words within the entities i.e. given an outcome "systolic blood pressure", the models are rewarded a classification score only when they predict all 3 words in sequence, otherwise, they are not rewarded. We observe our best model (BioBERT) achieve 81.5\% F1, 81.3\% sensitivity and 98.0\% specificity. We reach a consensus on which contextualized representations are best suited for detecting outcomes from clinical-trial abstracts. Furthermore, our best model outperforms scores published on the original EBM-NLP dataset leader-board scores.

연구 동기 및 목표

  • 임상 시험 결과 탐지에 적합한 고품질의 표준화된 결과 주석 코퍼스가 부족한 문제를 해결하기 위해.
  • 개별 단어가 아닌 전체 어휘를 탐지하는 데 초점을 맞춘 문맥 기반 표현(예: BioBERT, SciBERT)의 성능을 평가하기 위해.
  • 완전하고 연속적인 어휘 예측에만 보상을 주는 엄격한 평가 프로토콜을 사용하여 전체 어휘 결과 탐지의 벤치마크를 설정하기 위해.
  • 임상 결과 탐지 맥락에서, 미세조정된 문맥 기반 모델과 특징 추출 및 문맥 독립적 접근 방식 간의 성능을 비교하기 위해.
  • 증거 기반 의학 및 체계적 문헌 고찰 워크플로우에서 사용하기 위한 자동 결과 추출의 정확성과 신뢰성을 향상시키기 위해.

제안 방법

  • 표준화된 분류 체계를 사용하여 300개의 RCT 초록을 결과 어휘로 주석 처리하여 EBM-COMET 데이터셋을 구축한다.
  • EBM-COMET 데이터셋을 기반으로 도메인 전용 문맥 기반 언어 모델(BioBERT, SciBERT, ClinicalBERT)을 미세조정하여 결과 어휘 탐지 작업을 수행한다.
  • 임상적으로 유용한 품사 정보 임베딩과 비용 민감한 손실 함수를 통합한 커스터마이징된 신경망 모델을 사용하여 탐지 성능을 향상시킨다.
  • 엄격한 전체 어휘 탐지 평가 프로토콜을 사용하여 평가하며, 부분적 또는 분할된 예측은 보상되지 않고 완전하고 연속적인 결과 어휘 예측에만 점수가 주어진다.
  • 다양한 문맥 기반 표현(문맥 의존적 및 문맥 독립적)과 학습 전략(미세조정 대 특징 추출) 간의 성능을 비교한다.
  • 어휘 길이에 따른 성능 분석과 오류 분석을 통해 실패 원인을 규명하며, 특히 긴 어휘나 모호한 어휘에 대한 문제점을 파악한다.

실험 결과

연구 질문

  • RQ1임상 시험 초록에서 전체 결과 어휘를 탐지하는 데 가장 우수한 성능을 보이는 문맥 기반 표현 모델은 무엇인가?
  • RQ2미세조정된 모델과 특징 추출 방식 간의 결과 어휘 탐지 성능에서의 차이는 무엇인가?
  • RQ3표준화된 결과 어휘 분류 체계를 사용할 경우 결과 주석의 품질과 일관성은 어느 정도 향상되는가?
  • RQ4결과 어휘의 길이에 따라 모델 성능과 오류 패atters는 어떻게 변화하는가, 특히 다어휘 어휘의 경우 어떻게 되는가?
  • RQ5엄격한 전체 어휘 평가 방식은 기존의 토큰 수준 평가와 비교해 모델 성능에 있어 유의미한 차이를 드러내는가?

주요 결과

  • 미세조정된 BioBERT 모델이 EBM-COMET 데이터셋에서 가장 높은 성능을 기록하여 F1 점수 81.5%, 민감도 81.3%, 특이도 98.0%를 달성하였다.
  • 미세조정된 모델은 특징 추출 방식보다 일관되게 뛰어난 성능을 보였으며 수렴 속도도 더 빠르게 나타나, 결과 탐지 작업에 맞는 종단 간 적응의 이점이 있음을 시사한다.
  • 최고의 모델은 원래의 EBM-NLP 랭킹에서 기존 SOTA 성능을 초월하여 PIO 과제에서 결과 탐지의 F1 점수 73.1%를 기록하였다.
  • 6단어를 초과하는 결과 어휘에 대해 성능이 급격히 떨어졌으며, 두 모델 모두 7단어 이상의 어휘 전체를 정확히 탐지하는 데 어려움을 겪었다.
  • 엄격한 전체 어휘 평가에서 모델들이 종종 부분적인 어휘를 잘못 분류하는 것으로 나타났다. 예를 들어 '수축기 혈압'에서 'of'를 누락하는 경우가 있었으며, 이는 토큰 수준 정밀도는 높지만 F1 점수는 0이 되는 결과를 초래했다.
  • 오류 분석 결과 공통 기능어(예: 'of')와 겹치는 어휘(예: '우측 심장 크기 및 기능')가 잘못 분류의 주요 원인임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.