Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating robustness of language models for chief complaint extraction from patient-generated text

Ilya Valmianski, Caleb Goodwin|arXiv (Cornell University)|2019. 11. 15.
Topic Modeling참고 문헌 14인용 수 4
한 줄 요약

이 연구는 약 20만 건의 환자 진료 목적 기록을 포함하는 새로운 데이터셋을 바탕으로, 미세튜닝된 BERT 모델과 TF-IDF 기반 모델이 환자 생성 텍스트에서 구조화된 주소진술을 추출하는 데 있어 견고성을 평가한다. 놀랍게도, TF-IDF 기반 모델이 테스트 세트에서 최고의 미세튜닝 BERT 모델(CC BERT)보다 성능이 뛰어나며(PR-AUC 0.3878 대비 0.3597, p=7×10⁻⁵)도, 질적 분석에서는 BERT 모델이 오타나 복잡한 질의에 더 뛰어난 견고성을 보였다.

ABSTRACT

Automated classification of chief complaints from patient-generated text is a critical first step in developing scalable platforms to triage patients without human intervention. In this work, we evaluate several approaches to chief complaint classification using a novel Chief Complaint (CC) Dataset that contains ~200,000 patient-generated reasons-for-visit entries mapped to a set of 795 discrete chief complaints. We examine the use of several fine-tuned bidirectional transformer (BERT) models trained on both unrelated texts as well as on the CC dataset. We contrast this performance with a TF-IDF baseline. Our evaluation has three components: (1) a random test hold-out from the original dataset; (2) a "misspelling set," consisting of a hand-selected subset of the test set, where every entry has at least one misspelling; (3) a separate experimenter-generated free-text set. We find that the TF-IDF model performs significantly better than the strongest BERT-based model on the test (best BERT PR-AUC $0.3597 \pm 0.0041$ vs TF-IDF PR-AUC $0.3878 \pm 0.0148$, $p=7\cdot 10^{-5}$), and is statistically comparable to the misspelling sets (best BERT PR-AUC $0.2579 \pm 0.0079$ vs TF-IDF PR-AUC $0.2733 \pm 0.0130$, $p=0.06$). However, when examining model predictions on experimenter-generated queries, some concerns arise about TF-IDF baseline's robustness. Our results suggest that in certain tasks, simple language embedding baselines may be very performant; however, truly understanding their robustness requires further analysis.

연구 동기 및 목표

  • 임상 NLP 작업을 위한 환자 생성 진료 목적 기록을 구조화된 주소진술에 매핑한 새로운 대규모 데이터셋을 개발하기 위해.
  • 사전 훈련된 언어 모델(BERT 변종)과 TF-IDF 기반 모델이 자유형 텍스트 환자 입력에서 구조화된 주소진술을 추출하는 데 있어 성능과 견고성을 평가하기 위해.
  • 오타 및 비표준 환자 언어를 포함한 분포 이탈 상황에서의 모델 행동을 평가하기 위해.
  • 텍스트 임베딩에 연령 및 성별 등의 인구통계학적 특징을 통합하여 분류 성능 향상 여부를 조사하기 위해.

제안 방법

  • 환자 연령(이산화된)과 생물학적 성별에 대한 학습된 임베딩을 사전 훈련된 텍스트 임베딩(BERT, BioBERT, Clinical BERT, KP BERT, CC BERT)과 결합하는 피드포워드 신경망을 구축하였다.
  • 190,243개의 훈련 만남과 31,815개의 테스트 만남을 포함하는 데이터셋에서 5겹 교차검증을 사용하여 모델을 훈련하였으며, 총 795개의 고유한 주소진술이 존재하였다.
  • 세 가지 테스트 세트에서 모델을 평가하였다: 표준 보류 테스트 세트, 수작업으로 정제한 오타 포함 세트(최소 한 개 이상의 오타 포함 245건), 연구자들이 생성한 자유형 텍스트 질의 세트.
  • 주요 평가 지표로 마이크로 평균 PR-AUC와 ROC-AUC를 사용하였으며, 통계적 유의성 검정에는 웰치의 t-검정을 적용하였다.
  • TF-IDF 기반 모델의 경우 정지어 제거 및 n-그램 토크나이제이션을 적용하였으며, 이는 환자 텍스트 코퍼스에서 훈련되었다.
  • 분포 이탈 질의에 대한 모델 예측을 질적 분석하여 맥락, 인구통계학적 정보, 철자 오류에 대한 민감도를 평가하였다.

실험 결과

연구 질문

  • RQ1TF-IDF 기반 모델이 환자 생성 텍스트에서 구조화된 주소진술을 추출하는 데 있어 미세튜닝된 BERT 모델보다 성능이 뛰어나나?
  • RQ2TF-IDF 모델과 BERT 기반 모델이 오타나 비표준 언어와 같은 분포 이탈 상황에서 어떻게 성능을 보이나?
  • RQ3연령 및 성별 등의 인구통계학적 특징이 텍스트 임베딩 모델의 주소진술 분류 성능 향상에 어느 정도 기여하는가?
  • RQ4BERT 기반 모델이 훈련 데이터에 없던 복잡하거나 일상적인 환자 언어에 대해 TF-IDF보다 더 견고한가?
  • RQ5저자원 임상 NLP 환경에서 모델 아키텍처와 사전 훈련이 견고성에 미치는 상대적 영향은 무엇인가?

주요 결과

  • TF-IDF 기반 모델은 표준 테스트 세트에서 마이크로-PR-AUC 0.3878±0.0148를 기록하여, 최고의 BERT 모델(CC BERT)의 PR-AUC 0.3597±0.0041보다 유의미하게 높게 나타났다(p=7×10⁻⁵).
  • 오타 포함 테스트 세트에서 TF-IDF 기반 모델은 PR-AUC 0.2733±0.0130을 기록하였고, CC BERT는 0.2579±0.0079를 기록하였으며, 통계적으로 유의미한 차이가 없었다(p=0.06).
  • 표준 기준 평가에서 뛰어난 성능를 보였음에도 불구하고, TF-IDF 모델은 비표준 언어나 일상어, 심한 오타를 포함한 분포 이탈 질의에 대해 BERT 기반 모델보다 견고성이 떨어졌다.
  • BERT 기반 모델, 특히 KP BERT와 CC BERT는 맥락적 단서와 인구통계학적 정보에 더 민감하게 반응하여, 같은 증상에 대해 환자 연령에 따라 다른 주소진술을 정확히 예측하였다.
  • 분포 이탈 상황에서 TF-IDF와 BERT 모델 간 성능 격차가 좁혀지며, TF-IDF 모델이 실제 환자 입력의 언어적 다양성에 더 민감할 수 있음을 시사하였다.
  • 질적 분석을 통해 BERT 모델은 '내 터무니가 아프다' → 'abdominal pain'과 같은 드문 또는 비표준 표현을 정확히 분류할 수 있었으며, 이는 비표준 언어에 대한 더 나은 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.