[논문 리뷰] SODA: A Natural Language Processing Package to Extract Social Determinants of Health for Cancer Studies
SODA는 암 환자의 임상 노트에서 19개의 사회적 건강 결정 요인(SDoH)을 추출하기 위해 최적화된 BERT 모델을 사용하는 오픈소스 NLP 패키지입니다. SDoH 개념 추출에 대해 엄격 기준 F1 스코어 92.16%를 기록했으며, 수정된 데이터로 미리 훈련된 후에도 옥시코돈 사용 환자 집단으로의 일반화 능력을 입증했고, 새로운 주석 데이터에서 성능 향상을 보였습니다.
Objective: We aim to develop an open-source natural language processing (NLP) package, SODA (i.e., SOcial DeterminAnts), with pre-trained transformer models to extract social determinants of health (SDoH) for cancer patients, examine the generalizability of SODA to a new disease domain (i.e., opioid use), and evaluate the extraction rate of SDoH using cancer populations. Methods: We identified SDoH categories and attributes and developed an SDoH corpus using clinical notes from a general cancer cohort. We compared four transformer-based NLP models to extract SDoH, examined the generalizability of NLP models to a cohort of patients prescribed with opioids, and explored customization strategies to improve performance. We applied the best NLP model to extract 19 categories of SDoH from the breast (n=7,971), lung (n=11,804), and colorectal cancer (n=6,240) cohorts. Results and Conclusion: We developed a corpus of 629 cancer patients notes with annotations of 13,193 SDoH concepts/attributes from 19 categories of SDoH. The Bidirectional Encoder Representations from Transformers (BERT) model achieved the best strict/lenient F1 scores of 0.9216 and 0.9441 for SDoH concept extraction, 0.9617 and 0.9626 for linking attributes to SDoH concepts. Fine-tuning the NLP models using new annotations from opioid use patients improved the strict/lenient F1 scores from 0.8172/0.8502 to 0.8312/0.8679. The extraction rates among 19 categories of SDoH varied greatly, where 10 SDoH could be extracted from >70% of cancer patients, but 9 SDoH had a low extraction rate (<70% of cancer patients). The SODA package with pre-trained transformer models is publicly available at https://github.com/uf-hobiinformatics-lab/SDoH_SODA.
연구 동기 및 목표
- 암 환자의 임상 노트에서 사회적 건강 결정 요인(SDoH)을 추출하기 위한 오픈소스 NLP 도구 개발.
- SODA 모델이 새로운 질환 영역인 옥시코돈 사용 장애 영역으로의 일반화 능력 평가.
- 유방암, 폐암, 대장암 집단에서 19개의 서로 다른 카테고리에 걸쳐 SDoH 추출 성능 평가.
- 새로운 임상 인구집단에서 성능 향상을 위해 미세조정을 통한 맞춤 전략 탐색.
- 공개된 NLP 패키지 및 사전 훈련된 트랜스포머 모델을 제공하여 연구 공동체의 보편적 활용 지원.
제안 방법
- 19개 카테고리에 걸쳐 총 13,193개의 SDoH 개념을 주석 처리한 629건의 암 환자 임상 노트로 구성된 정제된 SDoH 코퍼스 구축.
- 4종의 트랜스포머 기반 NLP 모델 평가 후, 개념 및 속성 추출의 F1 스코어 기반으로 BERT를 최적의 모델로 선정.
- 옥시코돈 처방 환자 집단의 새로운 주석 데이터를 활용해 모델의 이식성 평가를 위해 BERT 모델을 미세조정.
- SDoH 개념 및 속성 추출의 정밀도, 재현도, F1 스코어 평가를 위해 엄격 및 유연한 평가 지표 도입.
- 성능이 가장 뛰어난 모델을 활용해 세 가지 주요 암 집단(유방암 n=7,971, 폐암 n=11,804, 대장암 n=6,240)에서 SDoH 추출 수행.
- 공개 저장소를 통해 사전 훈련된 모델을 포함한 SODA 패키지 배포.
실험 결과
연구 질문
- RQ1트랜스포머 기반 NLP 모델은 암 환자의 임상 노트에서 사회적 건강 결정 요인을 얼마나 잘 추출하는가?
- RQ2SODA 모델은 옥시코돈 사용 장애와 같은 새로운 임상 영역으로 일반화되는 데 얼마나 잘 적응하는가?
- RQ3주요 암 유형에서 SDoH 카테고리 중 가장 자주 및 가장 적게 추출되는 항목은 무엇인가?
- RQ4새로운 임상 주석 데이터로 모델을 미세조정하면 이전에 볼 수 없었던 인구집단에서의 성능 향상이 이루어지는가?
- RQ5맞춤 전략의 영향은 SDoH 추출 정확도와 견고성에 어떤 영향을 미치는가?
주요 결과
- BERT 모델은 SDoH 개념 추출에서 엄격 기준 F1 스코어 0.9216, 유연 기준 F1 스코어 0.9441을 기록해 최고 성능를 보였다.
- SDoH 개념에 속성 연결 작업에서는 BERT 모델이 엄격 기준 F1 스코어 0.9617, 유연 기준 F1 스코어 0.9626을 기록했다.
- 옥시코돈 사용 환자 집단의 주석 데이터로 미세조정한 결과, 엄격 기준 F1 스코어가 0.8172에서 0.8312로, 유연 기준 F1 스코어가 0.8502에서 0.8679로 향상되었다.
- 10개의 SDoH 카테고리는 암 환자 70% 이상에서 추출 가능했고, 9개의 카테고리는 추출 비율이 70% 이하였다.
- 사전 훈련된 모델을 포함한 SODA 패키지는 공개되어 있으며, 임상 텍스트에서 재현 가능하고 확장 가능한 SDoH 추출을 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.