[논문 리뷰] COVID-19-CT-CXR: a freely accessible and weakly labeled chest X-ray and CT image collection on COVID-19 from biomedical literature
이 논문은 NLP 및 딥러닝을 사용하여 PubMed Central 오픈 액세스 논문에서 자동으로 추출한 텍스트 기술서와 함께, 1,327개의 흉부 CT 및 263개의 흉부 X-ray 영상이 포함된 공개 데이터베이스인 COVID-19-CT-CXR를 소개한다. 이 데이터셋은 AI 모델이 COVID-19와 비-COVID-19 영상 간을 분류하는 데 성능을 향상시키며, 과학적 문헌에서 텍스트 마이닝된 증상과 영상학적 특징을 통해 COVID-19와 인플루엔자 간 임상적 소견을 비교 분석할 수 있도록 한다.
The latest threat to global health is the COVID-19 outbreak. Although there exist large datasets of chest X-rays (CXR) and computed tomography (CT) scans, few COVID-19 image collections are currently available due to patient privacy. At the same time, there is a rapid growth of COVID-19-relevant articles in the biomedical literature. Here, we present COVID-19-CT-CXR, a public database of COVID-19 CXR and CT images, which are automatically extracted from COVID-19-relevant articles from the PubMed Central Open Access (PMC-OA) Subset. We extracted figures, associated captions, and relevant figure descriptions in the article and separated compound figures into subfigures. We also designed a deep-learning model to distinguish them from other figure types and to classify them accordingly. The final database includes 1,327 CT and 263 CXR images (as of May 9, 2020) with their relevant text. To demonstrate the utility of COVID-19-CT-CXR, we conducted four case studies. (1) We show that COVID-19-CT-CXR, when used as additional training data, is able to contribute to improved DL performance for the classification of COVID-19 and non-COVID-19 CT. (2) We collected CT images of influenza and trained a DL baseline to distinguish a diagnosis of COVID-19, influenza, or normal or other types of diseases on CT. (3) We trained an unsupervised one-class classifier from non-COVID-19 CXR and performed anomaly detection to detect COVID-19 CXR. (4) From text-mined captions and figure descriptions, we compared clinical symptoms and clinical findings of COVID-19 vs. those of influenza to demonstrate the disease differences in the scientific publications. We believe that our work is complementary to existing resources and hope that it will contribute to medical image analysis of the COVID-19 pandemic. The dataset, code, and DL models are publicly available at https://github.com/ncbi-nlp/COVID-19-CT-CXR.
연구 동기 및 목표
- 개인정보 보호 및 데이터 접근 제약로 인해 공개적으로 이용 가능한(annotation된) COVID-19 의료 영상 데이터의 부족 문제를 해결하기 위해.
- PubMed Central 오픈 액세스 서브셋의 전문 생물의학 논문에서 흉부 X-ray 및 CT 영상을 자동으로 추출하고 분류하는 파이프라인을 개발하기 위해.
- 다양한 모odalities(CT, CXR, 기타)로 분류된 영상의 세부적인 텍스트 기술서를 그림 제목과 그림 설명에서 추출하여 다중모달 AI 연구를 지원하기 위해.
- 이 데이터셋이 딥러닝 모델의 COVID-19 분류 및 이방성 탐지 성능 향상에 어떻게 기여하는지 입증하기 위해.
- 과학 문헌에서 텍스트 마이닝된 데이터를 활용하여 COVID-19와 인플루엔자 간 임상 증상 및 영상학적 소견을 비교 분석할 수 있도록 하기 위해.
제안 방법
- 문서 파싱 및 레이아웃 분석을 사용하여 PubMed Central 오픈 액세스(PMC-OA) 논문에서 그림, 그림 제목, 관련 그림 설명을 자동으로 추출하기 위해.
- ImageCLEF Medical 데이터셋으로 미리 훈련된 딥러닝 모델을 미세조정하여 복합 그림을 개별 하위그림으로 분할하기 위해.
- 의료 영상 유형으로 훈련된 딥러닝 모델을 사용하여 추출된 하위그림을 모odalities(CT, CXR, 기타)로 분류하기 위해.
- 비-COVID-19 CXR 영상만으로 훈련된 일종의 이상 탐지 모델을 적용하여 잠재적인 COVID-19 사례를 탐지하기 위해.
- 그림 제목과 설명에 대한 텍스트 마이닝을 수행하여 COVID-19와 인플루엔자 간 임상 증상 및 영상학적 소견을 비교 분석하기 위해.
- 데이터셋, 코드, 훈련된 모델을 GitHub를 통해 공개하여 재현 가능성 및 향후 연구를 지원하기 위해.
실험 결과
연구 질문
- RQ1과학 문헌에서 자동으로 추출된 약한 레이블이 부여된 의료 영상이 비-COVID-19 흉부 CT 영상과의 분류에서 딥러닝 모델의 성능 향상에 기여할 수 있는가?
- RQ2비-COVID-19 사례만으로 훈련된 일종의 학습 접근법이, 추출된 데이터셋을 기반으로 CXR에서 COVID-19를 탐지하는 데 얼마나 효과적인가?
- RQ3생물의학 문헌에 반영된 바에 따르면, COVID-19와 인플루엔자 간 임상 증상 및 영상학적 소견의 주요 차이는 무엇인가?
- RQ4그림 제목과 설명에서 텍스트 마이닝된 기술서는 COVID-19의 영상학적 패턴 검증 및 발견에 얼마나 기여할 수 있는가?
- RQ5전체 논문에서의 자동 영상 및 텍스트 추출 기술은 향후 의료 영상 연구를 지원하기 위해 어떻게 확장 및 개선될 수 있는가?
주요 결과
- COVID-19-CT-CXR를 추가 학습 데이터로 포함시킴으로써, 딥러닝 모델이 비-COVID-19 흉부 CT 영상과의 분류 성능이 향상됨을 확인함.
- 비-COVID-19 CXR 영상만으로 훈련된 일종의 이상 탐지 모델이, 감독 학습 기반의 CT 기반 모델과 유사한 성능을 보였으며, 이는 CXR에서 COVID-19의 제로샷 탐지 가능성 잠재력을 보여줌.
- 텍스트 마이닝 분석 결과, 기저귀렴성 병변(GGO)은 인플루엔자에 비해 COVID-19에서 더 자주 보고되었고, '침윤'은 인플루엔자에서 더 흔히 기록됨을 확인함. 이는 영상학적 용어 및 질병의 임상적 표현 방식의 차이를 반영함.
- 발열과 기침은 COVID-19에서 가장 자주 보고된 증상으로, CDC 및 기타 연구 결과와 일치함.
- 이 데이터셋을 통해 공통 증상 15종과 임상 소견 20종을 특정할 수 있었으며, GGO는 COVID-19에서 주요 특징이었고, 경화 및 폐렴은 두 질환 모두에서 공통적으로 나타남.
- 하위그림 분할 및 텍스트 추출 범위의 한계가 존재하지만, 이 데이터셋은 AI 개발 및 영상의학 연구를 위한 보완 자원으로 강력한 잠재력을 보임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.