Skip to main content
QUICK REVIEW

[论文解读] Words are all you need? Language as an approximation for human similarity judgments

Raja Marjieh, Pol van Rijn|arXiv (Cornell University)|Jun 8, 2022
Machine Learning in Healthcare被引用 8
一句话总结

本文提出使用基于语言的方法——如词嵌入、共现统计和TF-IDF——来近似图像、音频和视频中的相似性判断,显著减少了对昂贵的成对人工判断的需求。实验表明,基于语言的模型优于预训练的深度神经网络(DNN),而将语言嵌入与DNN嵌入结合的堆叠模型表现最佳,同时发布了包含206,339个成对人工判断的完整数据集以支持可复现性。

ABSTRACT

Human similarity judgments are a powerful supervision signal for machine learning applications based on techniques such as contrastive learning, information retrieval, and model alignment, but classical methods for collecting human similarity judgments are too expensive to be used at scale. Recent methods propose using pre-trained deep neural networks (DNNs) to approximate human similarity, but pre-trained DNNs may not be available for certain domains (e.g., medical images, low-resource languages) and their performance in approximating human similarity has not been extensively tested. We conducted an evaluation of 611 pre-trained models across three domains -- images, audio, video -- and found that there is a large gap in performance between human similarity judgments and pre-trained DNNs. To address this gap, we propose a new class of similarity approximation methods based on language. To collect the language data required by these new methods, we also developed and validated a novel adaptive tag collection pipeline. We find that our proposed language-based methods are significantly cheaper, in the number of human judgments, than classical methods, but still improve performance over the DNN-based methods. Finally, we also develop `stacked' methods that combine language embeddings with DNN embeddings, and find that these consistently provide the best approximations for human similarity across all three of our modalities. Based on the results of this comprehensive study, we provide a concise guide for researchers interested in collecting or approximating human similarity data. To accompany this guide, we also release all of the similarity and language data, a total of 206,339 human judgments, that we collected in our experiments, along with a detailed breakdown of all modeling results.

研究动机与目标

  • 为解决人工相似性判断成本高昂的问题,其成本随刺激数量的平方增长。
  • 评估611个预训练深度神经网络(DNN)在近似图像、音频和视频中人类相似性判断方面的性能。
  • 开发并验证一种低成本、可扩展的替代方案,利用语言描述(标签和字幕)替代人工成对判断。
  • 比较基于语言的方法与基于DNN的近似方法,并评估通过堆叠模型结合两者的优势。
  • 发布一个包含206,339条人工相似性判断的完整数据集,以及所有建模结果,以支持可复现性和未来研究。

提出的方法

  • 通过众包方式收集了206,339对刺激在图像、音频和视频三种模态下的成对人工相似性判断。
  • 开发了一种自适应标签收集流程,以O(N)的成本而非O(N²)的成本,高效获取每个刺激的文本描述(标签和字幕)。
  • 应用多种基于语言的相似性计算方法:共现统计、共现重加权(co-occurrence-rep)、ROUGE、BM25、TF-IDF结合余弦相似度,以及去除停用词和词形还原后的词袋表示。
  • 评估了611个预训练DNN嵌入在所有三种模态下的表现,以基准其与人工相似性判断的一致性。
  • 通过堆叠模型将语言嵌入与DNN嵌入结合,并使用交叉验证的岭回归(LT-CCV)对预测结果进行微调。
  • 在MATLAB和scikit-learn中使用标准化的预处理和相似性计算流程,以确保一致性和可复现性。

实验结果

研究问题

  • RQ1预训练的深度神经网络(DNN)嵌入在图像、音频和视频中,其对人工相似性判断的近似效果如何?
  • RQ2基于语言的方法(使用标签和字幕)能否提供比成对人工判断更可扩展、更准确的替代方案?
  • RQ3在堆叠模型中,将语言嵌入与DNN嵌入结合后,性能提升程度如何?
  • RQ4与传统成对方法相比,基于语言的方法在数据收集成本(以人工判断数量计)上差异如何?
  • RQ5在不同模态中,哪种基于语言的相似性方法(如共现统计、TF-IDF、ROUGE)表现最佳?

主要发现

  • 预训练的DNN在所有三种模态(图像、音频、视频)中均显著低于人工相似性判断水平,表现出巨大的性能差距。
  • 基于语言的方法,特别是TF-IDF和BM25,在仅使用文本描述时优于基于DNN的近似方法,与人工判断的相关性更高。
  • 将语言嵌入与DNN嵌入结合的堆叠模型在所有模态中均表现出最佳性能,优于单独使用DNN或仅使用语言模型的方案。
  • 所提出的基于语言的方法将数据收集成本从O(N²)的成对判断降低至O(N)的单个刺激描述,实现了可扩展的相似性近似。
  • 本研究发布了包含206,339条人工相似性判断的完整数据集,以及所有模型结果,以支持可复现性和未来研究。
  • 使用岭回归(LT-CCV)对DNN嵌入进行微调仅在部分情况下提升性能,尤其在基于字幕的嵌入中表现更明显,但整体不稳定,未用于主分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。