[论文解读] Quantifying Learnability and Describability of Visual Concepts Emerging in Representation Learning
本文引入了两种基于人类的客观度量——可学习性与可描述性,以量化自监督表示学习所发现视觉概念的可解释性。通过将人类标注者视为分类器来衡量可学习性,并通过测试其根据文本描述识别类别的能力来评估可描述性,作者提出了一套原则性强、可扩展的评估框架,减少了主观性,并实现了人类与自动化图像字幕系统在类别级描述上的直接比较。
The increasing impact of black box models, and particularly of unsupervised ones, comes with an increasing interest in tools to understand and interpret them. In this paper, we consider in particular how to characterise visual groupings discovered automatically by deep neural networks, starting with state-of-the-art clustering methods. In some cases, clusters readily correspond to an existing labelled dataset. However, often they do not, yet they still maintain an "intuitive interpretability". We introduce two concepts, visual learnability and describability, that can be used to quantify the interpretability of arbitrary image groupings, including unsupervised ones. The idea is to measure (1) how well humans can learn to reproduce a grouping by measuring their ability to generalise from a small set of visual examples (learnability) and (2) whether the set of visual examples can be replaced by a succinct, textual description (describability). By assessing human annotators as classifiers, we remove the subjective quality of existing evaluation metrics. For better scalability, we finally propose a class-level captioning system to generate descriptions for visual groupings automatically and compare it to human annotators using the describability metric.
研究动机与目标
- 开发一种原则性强、客观的评估框架,用于评估自监督学习所发现视觉概念的可解释性。
- 通过将人类标注者作为分类器而非依赖主观命名或描述任务,减少可解释性评估中的主观性。
- 量化人类可学习性和可描述性的程度,特别是那些与现有标注数据集(如ImageNet)不一致的自监督视觉聚类。
- 探究自动化类别级字幕系统能否生成与人类水平可描述性相当的描述。
- 实现人类与机器生成的视觉聚类描述之间的直接、定量比较。
提出的方法
- 通过仅使用少量样本,训练人类标注者将图像分类为属于某一聚类或不属于该聚类,分类准确率作为语义一致性的客观度量,以衡量可学习性。
- 通过向标注者提供聚类的自然语言描述,并测量其基于描述正确分类新样本的能力,以评估可描述性。
- 使用类级别字幕系统——源自单图像字幕模型——自动为视觉聚类生成描述。
- 利用可描述性度量比较自动化字幕与人工标注描述的性能,以验证机器生成描述的质量。
- 设计一种强制选择实验设置,对人类在可学习性与可描述性两方面进行测试,确保评估的客观性与可扩展性。
- 引入一种独立于人类评估的描述验证度量,实现对视觉聚类字幕系统的自动化基准测试。
实验结果
研究问题
- RQ1即使概念未在标准数据集中标注,人类在仅凭少量样本的情况下,能在多大程度上学会识别一个视觉概念?
- RQ2一个视觉聚类能否通过简洁、自然的语言描述被忠实概括,从而使人类能够准确识别?
- RQ3自动化字幕系统在为视觉聚类生成描述方面,其质量与人工标注描述相比如何?
- RQ4所提出的度量——可学习性与可描述性——能否作为可解释性研究中主观人类评估的客观、可扩展的替代方案?
- RQ5自监督模型是否发现了未被标准图像分类标签捕获的语义一致的视觉概念?
主要发现
- 自监督模型即使在不与ImageNet等标准标签对齐的情况下,也能发现语义一致的视觉概念,这由高的人类可学习性得分所证实。
- 人类标注者基于少量样本即可实现高分类准确率,表明所发现聚类具有强语义一致性。
- 可描述性度量成功量化了自然语言描述捕捉视觉聚类本质的有效性,人工标注描述在大多数情况下优于基线自动化字幕。
- 所提出的类别级字幕系统能够生成与人工标注描述相媲美甚至更优的描述,尤其在基于聚类级数据微调后表现更佳。
- 该框架实现了人类与自动化描述之间的直接、定量比较,表明当适当调整后,自动化系统可达到高可描述性。
- 可学习性与可描述性度量为可解释性研究提供了一种可扩展、客观的替代主观评估方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。