Skip to main content
QUICK REVIEW

[논문 리뷰] BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once

Theodore Zhao, 裕二 池谷|arXiv (Cornell University)|2024. 05. 21.
AI in cancer detection인용 수 4
한 줄 요약

BiomedParse는 일관된 텍스트 프롬프트를 사용하여 82개의 객체 유형과 9개의 영상 모odal리티에서 동시에 분할, 탐지, 인식을 수행하는 생물의학 기초 모델이다. 사용자가 제공한 바운딩 박스가 필요 없으며, GPT-4를 활용해 노이즈가 많은 비정형 데이터셋 설명을 생물의학 온톨로지와 정렬함으로써, 사전 훈련을 위한 600만 건이 넘는 이미지-마스크-설명 트리플로 구성된 대규모 데이터셋을 생성함으로써 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Biomedical image analysis is fundamental for biomedical discovery in cell biology, pathology, radiology, and many other biomedical domains. Holistic image analysis comprises interdependent subtasks such as segmentation, detection, and recognition of relevant objects. Here, we propose BiomedParse, a biomedical foundation model for imaging parsing that can jointly conduct segmentation, detection, and recognition for 82 object types across 9 imaging modalities. Through joint learning, we can improve accuracy for individual tasks and enable novel applications such as segmenting all relevant objects in an image through a text prompt, rather than requiring users to laboriously specify the bounding box for each object. We leveraged readily available natural-language labels or descriptions accompanying those datasets and use GPT-4 to harmonize the noisy, unstructured text information with established biomedical object ontologies. We created a large dataset comprising over six million triples of image, segmentation mask, and textual description. On image segmentation, we showed that BiomedParse is broadly applicable, outperforming state-of-the-art methods on 102,855 test image-mask-label triples across 9 imaging modalities (everything). On object detection, which aims to locate a specific object of interest, BiomedParse again attained state-of-the-art performance, especially on objects with irregular shapes (everywhere). On object recognition, which aims to identify all objects in a given image along with their semantic types, we showed that BiomedParse can simultaneously segment and label all biomedical objects in an image (all at once). In summary, BiomedParse is an all-in-one tool for biomedical image analysis by jointly solving segmentation, detection, and recognition for all major biomedical image modalities, paving the path for efficient and accurate image-based biomedical discovery.

연구 동기 및 목표

  • 기존 생물의학 영상 분석 기법이 분할, 탐지, 인식을 별개의 작업으로 간주하고 사용자 부담이 크다는 한계를 해결하기 위해.
  • 분할 작업에서 사용자가 지정한 바운딩 박스가 필요 없도록, 이미지 내 모든 관련 객체를 텍스트 기반으로 0-샷으로 파싱할 수 있도록 하기 위해.
  • 분할, 탐지, 인식 간 상호의존성을 활용하여 통합적이고 확장 가능한 생물의학 영상 분석 프레임워크를 개발하기 위해.
  • 기존 표준 분할 데이터셋과 LLM을 활용한 생물의학 온톨로지 기반 의미 정합화를 통해 대규모 다중 모달리티 생물의학 영상 파싱 데이터셋을 구축하기 위해.

제안 방법

  • 모델는 기존 분할 데이터셋의 노이즈가 많은 비정형 자연어 설명을 생물의학 객체 온톨로지와 정렬하기 위해 GPT-4를 활용하여 구성한 600만 건이 넘는 이미지-마스크-설명 트리플로 구성된 데이터셋을 사전 훈련한다.
  • 단일 비전-언어 백본을 사용하여 분할, 탐지, 인식을 동시에 최적화하는 다중 작업 학습 프레임워크를 적용함으로써, 단일 텍스트 프롬프트에서부터 종단 간 파싱을 가능하게 한다.
  • 불규칙한 형태의 객체에 대해서는 교차상관관계를 통한 어텐션 맵 정밀화와 반복적 이동을 통해 마스크 정렬을 향상시키며, 특히 CT 및 MRI와 같은 3D 모달리티에서 효과가 뛰어나다.
  • 객체 인식은 두 단계 과정을 통해 수행된다: 첫째, 예측된 마스크 영역의 면적 기반 임계값(λ × 원본 면적)을 통한 대상 선택; 둘째, 픽셀 수준 확률 순위 기반의 겹침이 없는 마스크 집합화.
  • 82개의 생물의학 객체 유형을 9개의 영상 모달리티에 걸쳐 계층적으로 조직화한 타겟 구조를 사용하여, 모달리티별로도, 해부학적으로도 일관된 파싱을 가능하게 한다.
  • 탐지 평가 지표로는 형태 규칙성과 마스크 충실도를 측정하는 박스 비율(Box Ratio), 볼록 비율(Convex Ratio), 역 회전 관성률(Inverse Rotational Inertia, IRI)을 사용한다.

실험 결과

연구 질문

  • RQ1사용자가 제공한 바운딩 박스가 없이도 단일 기초 모델이 생물의학 영상에서 분할, 탐지, 인식을 동시에 수행할 수 있는가?
  • RQ2GPT-4를 활용해 표준 분할 데이터셋의 노이즈가 많은 비정형 텍스트 기술을 생물의학 온톨로지 기반의 구조화된 레이블로 정합화할 수 있는 정도는 어느 정도인가?
  • RQ3분할, 탐지, 인식 간 통합 학습이 다양한 생물의학 영상 모달리티에서 전용 모델 대비 성능 향상에 기여하는 정도는 어떠한가?
  • RQ4불규칙한 형태의 객체에 대해 바운딩 박스 기반 방법보다 더 정확하게 탐지할 수 있는가?
  • RQ5LLM 증강 기반 설명을 사용한 표준 분할 데이터셋만으로도 통합 영상 파싱 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • BiomedParse는 9개의 영상 모달리티에서 102,855개의 테스트 이미지-마스크-레이블 트리플에 대해 최신 기술 수준의 방법을 초월하며, 분할 분야에서 광범위한 적용 가능성을 입증했다.
  • 특히 불규칙한 형태의 객체에 대해 더 높은 박스 비율, 볼록 비율, IRI 지표를 확보하여 객체 탐지 성능에서 최신 기술 수준을 달성했다.
  • 텍스트 프롬프트 하나만으로도 이미지 내 모든 관련 생물의학 객체를 정확히 식별하고 분할할 수 있으며, 수동으로 바운딩 박스를 입력할 필요가 없다.
  • 이미지에 존재하지 않는 객체를 설명하는 잘못된 사용자 입력을 탐지하고 거부함으로써, 의미적 환각에 대한 강건성을 입증했다.
  • GPT-4를 활용해 비정형 설명을 생물의학 온톨로지와 정렬함으로써, 표준 분할 데이터셋만으로도 680만 개의 이미지-마스크-설명 트리플로 구성된 대규모 데이터셋을 구축할 수 있었다.
  • 두 단계 객체 인식 파이프라인은 마스크 겹침을 효과적으로 줄이고 선택 정확도를 향상시켜, Grounding DINO, SAM, MedSAM 기반 기준 모델보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.