Skip to main content
QUICK REVIEW

[논문 리뷰] The 2022 n2c2/UW Shared Task on Extracting Social Determinants of Health

Kevin Lybarger, Meliha Yetişgen|arXiv (Cornell University)|2023. 01. 13.
Food Security and Health in Diverse PopulationsHealth Professions인용 수 3
한 줄 요약

이 논문은 임상 노트에서 사회적 건강 결정 요인(SDOH)을 추출하기 위한 2022년 n2c2/UW 공동 과제를 제시한다. 이 과제는 물질 사용, 고용, 거주 상태와 같은 SDOH 요소에 대해 상태, 범위, 시간성 속성을 포함한 이벤트 기반 애너테이션을 제공하는 사회력 기록 코퍼스(SHAC)를 사용한다. 최고 성능을 기록한 시스템은 시퀀스 투 시퀀스 변환기 모델(T5)을 기반으로 하여 Subtask A에서 F1 점수 0.901을 달성했으며, 규칙 기반 및 전통적인 머신러닝 방법보다 뛰어난 성능을 보였다. 그러나 실업, 다물질 사용과 같은 고위험 SDOH 요소의 경우 보호적 요소보다 성능이 떨어지는 경향을 보였다.

ABSTRACT

Objective: The n2c2/UW SDOH Challenge explores the extraction of social determinant of health (SDOH) information from clinical notes. The objectives include the advancement of natural language processing (NLP) information extraction techniques for SDOH and clinical information more broadly. This paper presents the shared task, data, participating teams, performance results, and considerations for future work. Materials and Methods: The task used the Social History Annotated Corpus (SHAC), which consists of clinical text with detailed event-based annotations for SDOH events such as alcohol, drug, tobacco, employment, and living situation. Each SDOH event is characterized through attributes related to status, extent, and temporality. The task includes three subtasks related to information extraction (Subtask A), generalizability (Subtask B), and learning transfer (Subtask C). In addressing this task, participants utilized a range of techniques, including rules, knowledge bases, n-grams, word embeddings, and pretrained language models (LM). Results: A total of 15 teams participated, and the top teams utilized pretrained deep learning LM. The top team across all subtasks used a sequence-to-sequence approach achieving 0.901 F1 for Subtask A, 0.774 F1 Subtask B, and 0.889 F1 for Subtask C. Conclusions: Similar to many NLP tasks and domains, pretrained LM yielded the best performance, including generalizability and learning transfer. An error analysis indicates extraction performance varies by SDOH, with lower performance achieved for conditions, like substance use and homelessness, that increase health risks (risk factors) and higher performance achieved for conditions, like substance abstinence and living with family, that reduce health risks (protective factors).

연구 동기 및 목표

  • 비정형 임상 노트에서 사회적 건강 결정 요인(SDOH)을 추출하기 위한 자연어 처리(NLP) 기법을 발전시키기 위해.
  • 최근에 애너테이션된 임상 코퍼스를 기반으로 다양한 NLP 방법—규칙 기반 시스템에서부터 딥러닝 모델에 이르기까지—의 성능을 평가하기 위해.
  • SDOH 추출에서 도메인 간 일반화 능력과 전이 학습 잠재력 평가를 위해.
  • 물질 사용 및 실업과 같은 미묘하고 고위험 SDOH 요소를 추출하는 데의 과제를 규명하기 위해.
  • 취약 집단에 특히 영향을 미칠 수 있는 건강 위험 요소와 관련된 NLP 모델의 편향에 대한 통찰을 제공하기 위해.

제안 방법

  • 공동 과제는 사회력 기록 코퍼스(SHAC)를 사용하였으며, 이는 알코올, 약물, 니코틴, 고용, 거주 상황 등 13개의 SDOH 개념에 대해 이벤트 기반 애너테이션을 제공하는 임상 텍스트 코퍼스이다.
  • 애너테이션에는 상태(유무), 범위(빈도, 지속 기간), 시간성(과거/현재/미래) 등의 속성이 포함되어 있어 세밀한 이벤트 추출을 가능하게 한다.
  • 세 가지 서브태스크가 정의되었다: Subtask A(SDOH 추출, MIMIC 데이터 기반), Subtask B(유 UW 데이터로의 일반화 평가), Subtask C(도메인 내 데이터를 활용한 전이 학습 평가).
  • 참가자들은 규칙 기반 시스템, n-그램, 워드 임베딩, 지식 기반 시스템, 특히 사전 훈련된 언어 모델(BERT, T5 등)을 포함한 다양한 기법을 적용하였다.
  • 최고 성능을 기록한 시스템은 T5 기반의 시퀀스 투 시퀀스(seq2seq) 모델을 사용하였으며, 이는 원시 텍스트에서 직접 구조화된 SDOH 이벤트 출력을 생성하였다.
  • 성능 평가는 F1 점수를 기반으로 하였으며, 오류 분석은 SDOH 유형(위험 요소 대 보호적 요소) 및 이벤트 밀도에 따른 차이에 초점을 맞추었다.
Figure 1 : BRAT annotation example.
Figure 1 : BRAT annotation example.

실험 결과

연구 질문

  • RQ1규칙 기반, 전통적인 머신러닝, 딥러닝 모델 등 다양한 NLP 아키텍처가 임상 노트에서 SDOH를 추출하는 데 어떻게 성능을 내는가?
  • RQ2Subtask B에서 측정된 바와 같이, 한 EHR 소스에서 훈련된 모델이 다른 도메인으로 일반화할 수 있는 정도는 어느 정도인가?
  • RQ3Subtask C에서 평가된 바와 같이, 도메인 내 데이터로 파인튜닝할 때 전이 학습의 효과는 어떠한가?
  • RQ4특히 실업 및 다물질 사용과 같은 고위험 요소인 SDOH 요소가 왜 추출 성능이 낮게 나타나는가?
  • RQ5노트 내 SDOH 이벤트의 밀도가 추출 정확도에 어떤 영향을 미치는가?

주요 결과

  • 최고 성능을 기록한 시스템은 T5 기반의 시퀀스 투 시퀀스 모델을 사용하여 Subtask A에서 F1 점수 0.901, Subtask B에서 0.774, Subtask C에서 0.889를 기록했다.
  • 사전 훈련된 언어 모델은 규칙 기반, n-그램, 지식 기반 방법보다 뚜렷이 뛰어난 성능을 보였으며, 모든 서브태스크에서 딥러닝 모델이 우세한 성능을 기록했다.
  • 현재/과거의 물질 사용, 실업, 기능 장애 상태와 같은 고위험 SDOH 요소의 추출 성능은 기대치 및 가족과 함께 거주하는 것과 같은 보호적 요소보다 낮았다.
  • SDOH 이벤트 밀도가 증가할수록 성능이 저하되어, 여러 복잡한 사회적 필요를 포함하는 노트의 경우 정확한 추출이 더 어려운 것으로 나타났다.
  • 알코올, 약물, 니코틴, 고용과 같은 SDOH는 거주 상태보다 일반화 능력이 높았으며, 이는 일부 SDOH 유형에 대해 도메인 이동 문제의 존재를 시사한다.
  • 오류 분석 결과, NLP 모델이 고위험 SDOH를 과소 추출하는 경향이 있으며, 이는 건강 형평성 노력에 영향을 줄 수 있음을 밝혀냈다.
Figure 2 : Annotation examples describing event extraction as a slot filling task.
Figure 2 : Annotation examples describing event extraction as a slot filling task.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.