[논문 리뷰] Extracting Thyroid Nodules Characteristics from Ultrasound Reports Using Transformer-based Natural Language Processing Methods
이 연구는 보편적으로 코어퍼스를 활용하고 GatorTron을 포함한 미세조정된 모델을 사용하여 초음파 보고서에서 16개의 임상적으로 관련성이 높은 갑상선 농양 특성들을 추출하기 위한 트랜스포머 기반 NLP 프레임워크를 제안한다. GatorTron은 엄격 기준에서 F1 점수 0.8851, 관용 기준에서 0.9495를 기록하여 BERT, RoBERTa, LongFormer, DeBERTa를 모두 능가했으며, 임상 텍스트에서 종합적인 갑상선 농양 특성 분석에 대규모 NLP를 체계적으로 적용한 최초의 사례로 평가된다.
The ultrasound characteristics of thyroid nodules guide the evaluation of thyroid cancer in patients with thyroid nodules. However, the characteristics of thyroid nodules are often documented in clinical narratives such as ultrasound reports. Previous studies have examined natural language processing (NLP) methods in extracting a limited number of characteristics (<9) using rule-based NLP systems. In this study, a multidisciplinary team of NLP experts and thyroid specialists, identified thyroid nodule characteristics that are important for clinical care, composed annotation guidelines, developed a corpus, and compared 5 state-of-the-art transformer-based NLP methods, including BERT, RoBERTa, LongFormer, DeBERTa, and GatorTron, for extraction of thyroid nodule characteristics from ultrasound reports. Our GatorTron model, a transformer-based large language model trained using over 90 billion words of text, achieved the best strict and lenient F1-score of 0.8851 and 0.9495 for the extraction of a total number of 16 thyroid nodule characteristics, and 0.9321 for linking characteristics to nodules, outperforming other clinical transformer models. To the best of our knowledge, this is the first study to systematically categorize and apply transformer-based NLP models to extract a large number of clinical relevant thyroid nodule characteristics from ultrasound reports. This study lays ground for assessing the documentation quality of thyroid ultrasound reports and examining outcomes of patients with thyroid nodules using electronic health records.
연구 동기 및 목표
- 초음파 보고서에서 임상적 결론 수립에 관련성이 높은 16개의 갑상선 농양 특성들을 식별하고 체계적으로 분류하는 것.
- NLP 전문가와 갑상선 전문가의 협업을 통해 표준화된 주석 가이드라인을 개발하는 것.
- NLP 모델의 훈련 및 평가를 위한 고품질의 다학제적 주석 코퍼스를 구축하는 것.
- 비정형 임상 서술문에서 대규모 갑상선 농양 특성 세트를 추출하는 데 있어 최신 트랜스포머 기반 모델들의 성능을 비교하는 것.
- 갑상선 농양 치료의 전자 기록 기반 결과 연구 및 문서 품질 평가에 대한 향후 연구를 가능하게 하는 것.
제안 방법
- NLP 전문가와 갑상선 전문가로 구성된 다학제적 팀이 임상적 의사결정에 관련성이 높은 16개의 핵심 갑상선 농양 특성들을 정의했다.
- 표준화된 가이드라인을 따르며 정제된 초음파 보고서 코퍼스를 주석 처리하여 일관성과 임상적 관련성을 확보했다.
- BERT, RoBERTa, LongFormer, DeBERTa, GatorTron의 다섯 가지 최신 트랜스포머 모델을 주석 코퍼스에 맞게 미세조정하여 시퀀스 레이블링 작업을 수행했다.
- 16개 특성 추출의 정밀도와 재현도를 평가하기 위해 엄격 기준과 관용 기준의 F1 점수를 사용하여 모델 성능을 평가했다.
- 다중 농양 보고서에서 각 특성과 올바른 농양을 연결하는 능력을 평가하기 위해 별도의 연결 작업을 수행했다.
- 900억 단어 이상의 텍스트로 사전 훈련된 대규모 언어 모델인 GatorTron은 추출 및 연결 작업 모두에서 뛰어난 성능을 보여 선택되었다.
실험 결과
연구 질문
- RQ1어떤 트랜스포머 기반 NLP 모델이 초음파 보고서에서 종합적인 16개의 임상적으로 관련성이 높은 갑상선 농양 특성들을 추출하는 데 가장 우수한 성능을 보일까?
- RQ2이러한 임상 NLP 작업에서 BERT나 RoBERTa와 같은 소규모 모델에 비해 대규모 언어 모델인 GatorTron의 성능은 어떻게 비교되는가?
- RQ3표준화된 주석 가이드라인이 방사선 검사 보고서에서 갑상선 농양 특성을 주석 처리하는 데 일관성과 신뢰도를 향상시킬 수 있는가?
- RQ4다중 농양을 기술하는 보고서에서 NLP 모델이 추출한 특성들을 올바른 갑상선 농양과 연결하는 데 얼마나 정확한가?
- RQ5이 프레임워크가 전자 기록 기반의 갑상선 농양 치료 결과 연구 및 문서 품질 평가에 어떤 잠재력을 지닐 수 있는가?
주요 결과
- GatorTron은 초음파 보고서에서 16개의 갑상선 농양 특성을 추출하는 데 엄격 기준 F1 점수 0.8851, 관용 기준 F1 점수 0.9495를 기록하여 최고의 성능을 보였다.
- GatorTron은 BERT, RoBERTa, LongFormer, DeBERTa를 포함한 모든 다른 모델보다 추출 및 연결 작업 모두에서 뛰어난 성능을 보였다.
- 모델은 복잡한 보고서에서도 강력한 일반화 능력을 보이며, 올바른 농양과 특성을 연결하는 데 F1 점수 0.9321을 기록했다.
- 이 연구는 다양한 초음파 보고서에서 임상적으로 관련성이 높은 특성들을 일관되게 주석 처리할 수 있는 표준화된 주석 프레임워크를 확립했다.
- 이 연구는 비정형 임상 텍스트에서 대규모이고 임상적으로 종합적인 갑상선 농양 특성 세트를 추출하기 위해 트랜스포머 기반 NLP를 체계적으로 적용한 최초의 사례이다.
- 결과는 초음파 보고서 품질의 자동 평가 및 갑상선 농양 관리의 전자 기록 기반 결과 연구를 위한 기반을 마련했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.