Skip to main content
QUICK REVIEW

[논문 리뷰] CattleFace-RGBT: RGB-T Cattle Facial Landmark Benchmark

Ethan Coffman, Reagan Clark|arXiv (Cornell University)|2024. 06. 05.
Textile materials and evaluationsMaterials Science인용 수 3
한 줄 요약

이 논문은 눈, 귀, 코, 코끝, 입 등의 얼굴 기능에 대해 13개의 정의된 관건 랜드마크를 가진 2,300개의 이미지 쌍을 포함하는 RGB-T(색상 및 열화상) 소 얼굴 랜드마크 데이터셋인 CattleFace-RGBT를 소개한다. RGB에서 열화상 이미지로 지식을 전이하는 AI 보조 반자동 주석 처리 파이프라인을 통해 저자들은 최신 기술 모델을 평가하여, 다중모달 얼굴 분석을 통한 소 복지 모니터링 분야에서 ResNet101과 Swin-B를 강력한 기초 성능 기준으로 설정한다.

ABSTRACT

To address this challenge, we introduce CattleFace-RGBT, a RGB-T Cattle Facial Landmark dataset consisting of 2,300 RGB-T image pairs, a total of 4,600 images. Creating a landmark dataset is time-consuming, but AI-assisted annotation can help. However, applying AI to thermal images is challenging due to suboptimal results from direct thermal training and infeasible RGB-thermal alignment due to different camera views. Therefore, we opt to transfer models trained on RGB to thermal images and refine them using our AI-assisted annotation tool following a semi-automatic annotation approach. Accurately localizing facial key points on both RGB and thermal images enables us to not only discern the cattle's respiratory signs but also measure temperatures to assess the animal's thermal state. To the best of our knowledge, this is the first dataset for the cattle facial landmark on RGB-T images. We conduct benchmarking of the CattleFace-RGBT dataset across various backbone architectures, with the objective of establishing baselines for future research, analysis, and comparison. The dataset and models are at https://github.com/UARK-AICV/CattleFace-RGBT-benchmark

연구 동기 및 목표

  • 소 얼굴 랜드마크 검출을 위한 RGB와 열화상 영상을 융합한 다중모달 데이터셋의 부족을 해결하기 위해.
  • 얼굴 관건 랜드마크 위치 추정과 체온 측정을 통해 정확하고 자동화된 소 건강 평가를 가능하게 하기 위해.
  • RGB에서 열화상 데이터로의 전이 학습 기반 AI 보조 전이 학습 방법을 통해 열화상 이미지 주석 처리의 과제를 극복하기 위해.
  • 새로운 실세계 소 데이터셋에서 랜드마크 검출 모델의 성능 기준을 설정하기 위해.
  • 얼굴 표정과 열화상 상태 분석을 융합하여 AI 기반 소 복지 모니터링을 발전시키기 위해.

제안 방법

  • 2,300개의 쌍으로 구성된 RGB 및 열화상 이미지 쌍은 농장에서 수집되었으며, 눈, 귀, 코, 코끝, 입과 같은 주요 기능에 대해 13개의 얼굴 랜드마크가 주석 처리되었다.
  • 내부 개발한 C# 주석 도구를 통해 AI가 생성한 랜드마크의 정밀한 수동 보정이 가능하여 높은 주석 정확도를 확보한다.
  • 반자동 주석 파이프라인은 RGB로 훈련된 모델의 초기 랜드마크 예측을 열화상 이미지로 전이한 후 인간의 참여를 통한 정밀 조정을 수행한다.
  • 다른 카메라 시야로 인한 정렬 문제를 피하고, 열화상 모델을 직접 훈련할 경우 성능이 열악하므로 이를 회피하기 위해 이 방법을 사용한다.
  • ResNet50, ResNet101, ViT-B, Swin-B 등의 백본 네트워크를 Detectron2 프레임워크를 사용해 평가하였으며, 표준 AP, AP50, AP75 지표를 사용한다.
  • 학습은 훈련용 70%와 테스트용 30%로 분할하며, 배치 크기는 16, 옵티마이저는 AdamW를 사용하고 학습률은 1e-6로 설정한다.
Figure 1 : Example of RGB and thermal pair image with 13 annotated keypoints annotated in our CattleFace-RGBT dataset.
Figure 1 : Example of RGB and thermal pair image with 13 annotated keypoints annotated in our CattleFace-RGBT dataset.

실험 결과

연구 질문

  • RQ1기존의 랜드마크 검출 모델들이 새로운 RGB-T 소 얼굴 랜드마크 데이터셋에서 얼마나 효과적인가?
  • RQ2RGB 기반 모델의 지식을 열화상 이미지로 효과적으로 전이하여 정확한 랜드마크 주석 처리가 가능한가?
  • RQ3열화상 소 얼굴 데이터에서 CNN 기반과 Transformer 기반 백본 간의 성능 차이는 무엇인가?
  • RQ4AI 보조 전이 학습 방식과 수동 주석 처리 방식 간의 주석 품질 및 효율성은 어떻게 비교되는가?
  • RQ5다중모달 소 얼굴 데이터에서 랜드마크 검출의 기초 성능 지표는 무엇인가?

주요 결과

  • RGB 이미지에서 ResNet101은 경계 상자 검출에 76.12 AP, 랜드마크 검출에 94.37 AP로 가장 높은 종합 성능을 기록했다.
  • 열화상 이미지에서 ResNet101은 모든 지표에서 가장 높은 점수를 기록했으며, 경계 상자 검출에 72.30 AP, 랜드마크 검출에 64.60 AP를 기록했다.
  • RGB 이미지에서 Swin-B는 경계 상자 검출에 AP50와 AP75가 각각 100.00으로 기록하여 고 IoU 임계값에서 뛰어난 성능을 보였다.
  • 열화상 이미지의 성능은 RGB에 비해 뚜렷이 낮았으며, AP 점수가 최대 20~30점 감소한 것으로 보이며, 이는 열화상 데이터의 낮은 대비와 무늬 때문일 가능성이 높다.
  • 모든 모델이 RGB 이미지에서 랜드마크 검출에 대해 100.00 AP50를 기록하여 50% IoU 임계값에서 뛰어난 성능을 보였다.
  • AI 보조 주석 파이프라인은 열화상 이미지 품질 낮음과 카메라 시야 불일치 문제에도 불구하고 효율적이고 정확한 랜드마크 주석 처리를 가능하게 하였다.
Figure 2 : Examples of undesired images.
Figure 2 : Examples of undesired images.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.