Skip to main content
QUICK REVIEW

[논문 리뷰] BioCLIP: A Vision Foundation Model for the Tree of Life

Samuel Stevens, Jiaman Wu|arXiv (Cornell University)|2023. 11. 30.
Cell Image Analysis Techniques인용 수 9
한 줄 요약

논문은 TreeOfLife-10M를 소개한다. 이는 가장 큰 ML-준비 바이오 이미지 데이터셋이며, 계통학적 계층 구조를 활용한 CLIP-스타일 다중모달 대조 학습으로 훈련된 비전 기본 모델인 BioCLIP을 제시한다. 이를 통해 생명의 계통도 전체에서 제로샷 및 소수샷 분류를 가능하게 한다.

ABSTRACT

Images of the natural world, collected by a variety of cameras, from drones to individual phones, are increasingly abundant sources of biological information. There is an explosion of computational methods and tools, particularly computer vision, for extracting biologically relevant information from images for science and conservation. Yet most of these are bespoke approaches designed for a specific task and are not easily adaptable or extendable to new questions, contexts, and datasets. A vision model for general organismal biology questions on images is of timely need. To approach this, we curate and release TreeOfLife-10M, the largest and most diverse ML-ready dataset of biology images. We then develop BioCLIP, a foundation model for the tree of life, leveraging the unique properties of biology captured by TreeOfLife-10M, namely the abundance and variety of images of plants, animals, and fungi, together with the availability of rich structured biological knowledge. We rigorously benchmark our approach on diverse fine-grained biology classification tasks and find that BioCLIP consistently and substantially outperforms existing baselines (by 16% to 17% absolute). Intrinsic evaluation reveals that BioCLIP has learned a hierarchical representation conforming to the tree of life, shedding light on its strong generalizability. https://imageomics.github.io/bioclip has models, data and code.

연구 동기 및 목표

  • 대규모의 다양한 생물 이미지 데이터셋을 세우고 분류학적 라벨을 포함하여 기본 모델 사전 학습(TreeOfLife-10M)을 지원한다.
  • 미지의 분류군에 대한 일반화 향상을 위해 분류학적 구조를 활용하는 비전 기본 모델(BioCLIP)을 개발한다.
  • 다양한 고해상도 생물 분류 작업에서 강력한 제로샷 및 소수샷 성능을 보여준다.
  • 텍스트 유형(분류학적, 과학 명칭, 일반 명칭)이 모델 일반화에 미치는 영향을 조사한다.
  • 학습된 계층적 표현이 생명의 계통수와 일치함을 보여주는 고유 분석을 제공한다.

제안 방법

  • 표준화된 분류학 계층 구조를 가진 iNat21, Bioscan-1M, Encyclopedia of Life 이미지들을 합쳐 TreeOfLife-10M를 큐레이션한다.
  • OpenAI CLIP 가중치에서 초기화하고 CLIP의 다중모달 대조 목적을 사용하여 TreeOfLife-10M에서 사전 학습을 계속한다.
  • 분류학적 라벨을 분류학적 이름(낙엽화된 계층)으로 표현하고, CLIP 프레임워크에서 이 이름들과 이미지를 매칭하도록 모델을 학습한다.
  • 추론 시 유연성을 개선하기 위해 혼합 텍스트 유형(분류학적, 과학 명칭, 일반 명칭)을 실험한다.
  • 동물, 식물, 균류에 걸친 10개의 다양한 세밀한 데이터셋에서 제로샷 및 소수샷 성능을 평가하고 Rare Species 테스트 세트를 포함한다.
  • LAION-400M에서 학습된 CLIP 및 OpenCLIP과 BioCLIP를 비교하고 데이터 소스 및 텍스트 유형 전략을 제거(아블레이션)한다.
BioCLIP: A Vision Foundation Model for the Tree of Life

실험 결과

연구 질문

  • RQ1TreeOfLife-10M에서 학습된 비전 기본 모델이 훈련 데이터에 나타나지 않은 분류군에 대해 제로샷으로도 생명의 계통도 전반에 일반화할 수 있는가?
  • RQ2CLIP-스타일 목표를 통해 라벨 공간에 분류학적 구조를 인코딩하는 것이 미세한 생물 분류를 개선하는가, 특히 데이터가 적은 상황에서?
  • RQ3학습 동안 사용된 서로 다른 텍스트 유형(분류학적, 과학 명칭, 일반 명칭)이 제로샷 및 소수샷 일반화에 어떤 영향을 미치는가?
  • RQ4데이터 다양성(TreeOfLife-10M 대 iNat21)이 다운스트림 성능 및 미지의 분류군에 대한 일반화에 어떤 영향을 미치는가?
  • RQ5BioCLIP이 생명의 계통수를 반영하는 계층적 표현을 학습하는가, 그리고 이러한 점이 고유 분석에서 어떻게 나타나는가?

주요 결과

  • BioCLIP은 10개의 세밀한 생물 데이터셋에서 제로샷 기준으로 17–20个百分点 높게 베이스라인을 상회한다.
  • BioCLIP은 소수샷에서 강력한 향상을 달성하며 1샷 및 5샷 설정에서 CLIP 및 OpenCLIP에 비해 현저한 개선을 보인다.
  • 제로샷 성능은 보지 못한 Rare Species에서 특히 강하며, 훈련 데이터에 없는 분류군에 대한 일반화가 좋음을 시사한다.
  • 고유 분석은 BioCLIP이 생명의 계통수와 일치하는 계층적 특징 구조를 학습함을 보여주며, 일반화 향상을 설명한다.
  • 학습에 분류학적 이름을 사용하는 것이 과학 명칭만 사용할 때보다 제로샷 정확도를 크게 향상시키고, 혼합 텍스트 유형이 추론 시간 유연성을 높인다.
  • EOL 데이터를 포함한 TreeOfLife-10M의 다양성이 iNat21만 사용하는 것에 비해 성능을 크게 높인다.
(d) Onoclea sensibilis
(d) Onoclea sensibilis

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.