[论文解读] CattleFace-RGBT: RGB-T Cattle Facial Landmark Benchmark
本论文提出了 CattleFace-RGBT,这是首个包含 2,300 对图像与 13 个面部特征关键点(如眼睛、耳朵、鼻端和鼻孔)标注的 RGB-T(可见光与热成像)牛只面部关键点数据集。通过一种利用 AI 辅助的半自动标注流程,将可见光图像的知识迁移至热成像图像,作者对当前最先进的模型进行了基准测试,确立了 ResNet101 和 Swin-B 作为未来基于多模态面部分析进行牛只福利监测研究的强基准模型。
To address this challenge, we introduce CattleFace-RGBT, a RGB-T Cattle Facial Landmark dataset consisting of 2,300 RGB-T image pairs, a total of 4,600 images. Creating a landmark dataset is time-consuming, but AI-assisted annotation can help. However, applying AI to thermal images is challenging due to suboptimal results from direct thermal training and infeasible RGB-thermal alignment due to different camera views. Therefore, we opt to transfer models trained on RGB to thermal images and refine them using our AI-assisted annotation tool following a semi-automatic annotation approach. Accurately localizing facial key points on both RGB and thermal images enables us to not only discern the cattle's respiratory signs but also measure temperatures to assess the animal's thermal state. To the best of our knowledge, this is the first dataset for the cattle facial landmark on RGB-T images. We conduct benchmarking of the CattleFace-RGBT dataset across various backbone architectures, with the objective of establishing baselines for future research, analysis, and comparison. The dataset and models are at https://github.com/UARK-AICV/CattleFace-RGBT-benchmark
研究动机与目标
- 为解决当前缺乏结合可见光与热成像的多模态数据集,以支持牛只面部关键点检测的问题。
- 通过面部关键点定位与温度测量,实现对牛只健康状况的精确、自动化评估。
- 通过从可见光图像向热成像数据迁移知识的 AI 辅助迁移学习方法,克服热成像图像标注的挑战。
- 在新型真实世界牛只数据集上,为关键点检测模型建立性能基线。
- 通过整合面部表情与热状态分析,推动基于人工智能的牛只福利监测发展。
提出的方法
- 该数据集包含从农场采集的 2,300 对配对的可见光与热成像图像,关键点在眼睛、耳朵、鼻端、鼻孔和口部等面部特征上进行了标注。
- 自研的 C# 标注工具可对 AI 生成的关键点进行精确的人工校正,确保高标注精度。
- 采用半自动标注流程,将基于可见光模型生成的初始关键点预测迁移至热成像图像,随后通过人机协同方式优化。
- 由于直接训练热成像模型性能不佳,且避免因相机视角差异导致的对齐问题,因此未采用直接训练热成像模型的方法。
- 使用 Detectron2 框架评估了包括 ResNet50、ResNet101、ViT-B 和 Swin-B 在内的主干网络,采用标准的 AP、AP50 和 AP75 指标。
- 训练采用 70/30 的训练集与测试集划分,批量大小为 16,使用 AdamW 优化器,初始学习率为 1e-6。

实验结果
研究问题
- RQ1现有关键点检测模型在新型 RGB-T 牛只面部关键点数据集上的表现如何?
- RQ2基于可见光模型的知识能否有效迁移至热成像图像,以实现准确的关键点标注?
- RQ3在热成像牛只面部数据上,基于 CNN 的主干网络与基于 Transformer 的主干网络在性能上存在哪些差异?
- RQ4与纯人工标注相比,使用 AI 辅助迁移学习的标注在质量和效率上表现如何?
- RQ5在多模态牛只面部数据上,关键点检测的基线性能指标是什么?
主要发现
- 在可见光图像上,ResNet101 在边界框检测上达到最高整体性能,AP 为 76.12,在关键点检测上 AP 为 94.37。
- 在热成像图像上,ResNet101 在所有指标中均取得最高分,包括边界框检测 AP 为 72.30,关键点检测 AP 为 64.60。
- Swin-B 在可见光图像的边界框检测中,AP50 和 AP75 分别达到 100.00,表明其在高 IoU 阈值下表现优异。
- 热成像图像的性能显著低于可见光图像,AP 分数下降高达 20–30 分,可能由于热成像数据对比度和纹理较低所致。
- 所有模型在可见光图像上的关键点检测 AP50 均达到 100.00,表明在 50% IoU 阈值下表现极佳。
- AI 辅助标注流程尽管面临热成像图像质量差与相机视角错位等挑战,仍实现了高效且准确的关键点标注。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。