[论文解读] DABS: A Domain-Agnostic Benchmark for Self-Supervised Learning
DABS 提出了一项与领域无关的自监督学习(SSL)基准,评估模型在七个不同领域——图像、文本、语音、医学X光片、传感器数据、多语言文本以及视觉-语言——上的表现,所有领域均使用同一套SSL算法。该基准揭示,即使最先进的与领域无关的方法如 e-Mix 和 ShED 也表现出性能不均,表明在实现跨领域即插即用的SSL解决方案之前,仍有巨大改进空间。
Self-supervised learning algorithms, including BERT and SimCLR, have enabled significant strides in fields like natural language processing, computer vision, and speech processing. However, these algorithms are domain-specific, meaning that new self-supervised learning algorithms must be developed for each new setting, including myriad healthcare, scientific, and multimodal domains. To catalyze progress toward domain-agnostic methods, we introduce DABS: a Domain-Agnostic Benchmark for Self-supervised learning. To perform well on DABS, an algorithm is evaluated on seven diverse domains: natural images, multichannel sensor data, English text, speech recordings, multilingual text, chest x-rays, and images with text descriptions. Each domain contains an unlabeled dataset for pretraining; the model is then is scored based on its downstream performance on a set of labeled tasks in the domain. We also present e-Mix and ShED: two baseline domain-agnostic algorithms; their relatively modest performance demonstrates that significant progress is needed before self-supervised learning is an out-of-the-box solution for arbitrary domains. Code for benchmark datasets and baseline algorithms is available at https://github.com/alextamkin/dabs.
研究动机与目标
- 为跨多样化数据模态的与领域无关的自监督学习(SSL)提供标准化评估。
- 推动研究向无需领域特定调优即可跨领域泛化的SSL算法发展。
- 通过支持开箱即用的SSL应用,降低医疗保健和科研等资源匮乏领域的研究门槛。
- 通过在多个领域中统一评估方法,揭示超越单一模态的SSL基本原理。
- 提供共享的基准基础设施,包含标准化的数据集、预处理流程和评估协议,以支持跨领域SSL研究。
提出的方法
- DABS 构建了一个包含七个不同领域的基准:自然图像、英文文本、语音、多语言文本、胸部X光片、多通道传感器数据以及视觉-语言图像-文本对。
- 每个领域使用单一未标注数据集进行模型预训练,采用统一的SSL目标;下游任务则使用标注数据评估迁移性能。
- 通过所有下游任务的平均准确率或AUROC评估模型性能,确保模型架构和迁移方法在各领域间的一致性。
- 作者提出了两种与领域无关的SSL算法 e-Mix 和 ShED,将通用数据增强和对比学习原理应用于各类模态。
- 基准使用各领域标准化的预处理流程和评估指标,确保跨模态之间的公平比较。
- 代码和数据集已公开发布,以确保可复现性并促进社区采纳。
实验结果
研究问题
- RQ1单一自监督学习算法是否能在无需领域特定适配的情况下,在多样且无关的领域中实现强大性能?
- RQ2与随机初始化和领域特定基线相比,与领域无关的SSL方法在多种模态中的表现如何?
- RQ3哪些SSL组件能在模态间泛化,哪些无法迁移?
- RQ4现有SSL技术(如数据增强和对比学习)在图像、文本和音频等不同类型数据之间有多大的泛化能力?
- RQ5当前与领域无关的SSL方法的性能上限是什么,它们在哪些地方会失效?
主要发现
- 未进行预训练的基线模型在所有领域上的平均下游性能为39.6%,作为强大的零样本基线。
- e-Mix 和 ShED 在所有领域上均优于无预训练基线,其中 e-Mix 在英文文本任务上达到平均43.1%的准确率,ShED 在 RTE 文本任务上达到52.7%的准确率。
- 性能提升极不均衡:ShED 在 PAMAP2 传感器数据上达到88.69%的准确率,但在 Fluent Speech actions 上仅达30.53%,表明存在模态特定的失败模式。
- 在医学影像领域,ShED 将 CheXpert 的 AUROC 从无预训练时的68.14% 提升至74.50%,显示出在高影响力领域的潜力。
- 表现最佳的方法 ShED 在 PAWS-X 西班牙语任务上达到63.65%的准确率,但在日语任务上仅为52.00%,表明语言特定的局限性依然存在。
- 没有任何一种方法在所有领域中始终优于其他方法,凸显了当前尚无稳健、真正与领域无关的SSL解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。