[论文解读] Describing Differences between Text Distributions with Natural Language
本文提出一种方法,通过自然语言假设自动描述两个文本分布之间的差异,利用微调后的 GPT-3 和一个学习到的验证器对候选描述进行排序。该方法在 54 项任务的基准测试中实现了 76% 的准确率,生成的描述与人工标注结果相似,显著优于零样本提示的 GPT-3。
How do two distributions of texts differ? Humans are slow at answering this, since discovering patterns might require tediously reading through hundreds of samples. We propose to automatically summarize the differences by "learning a natural language hypothesis": given two distributions $D_{0}$ and $D_{1}$, we search for a description that is more often true for $D_{1}$, e.g., "is military-related." To tackle this problem, we fine-tune GPT-3 to propose descriptions with the prompt: "[samples of $D_{0}$] + [samples of $D_{1}$] + the difference between them is_____." We then re-rank the descriptions by checking how often they hold on a larger set of samples with a learned verifier. On a benchmark of 54 real-world binary classification tasks, while GPT-3 Curie (13B) only generates a description similar to human annotation 7% of the time, the performance reaches 61% with fine-tuning and re-ranking, and our best system using GPT-3 Davinci (175B) reaches 76%. We apply our system to describe distribution shifts, debug dataset shortcuts, summarize unknown tasks, and label text clusters, and present analyses based on automatically generated descriptions.
研究动机与目标
- 自动化发现能够区分两个文本分布(如训练/测试集划分或时间漂移)的自然语言描述。
- 解决人工难以手动检查数千个文本样本以检测分布差异的挑战。
- 通过引入微调和使用学习验证器进行重排序,改进零样本大语言模型提示,以生成更高质量的假设。
- 在真实世界 NLP 数据集、分布漂移检测和数据集捷径识别中验证该方法。
- 通过自然语言摘要实现对模型行为、数据偏见和文本趋势演变的可解释、人类可理解的分析。
提出的方法
- 在新收集的假设生成示例数据集上微调 GPT-3(Davinci,175B),以提升其提出自然语言描述的能力。
- 采用基于提示的方法:[D₀ 样本] + [D₁ 样本] + '它们之间的差异是',从 GPT-3 生成候选假设。
- 使用学习验证器对候选假设进行重排序,评估每个假设在 D₀ 和 D₁ 更大样本集中的成立频率。
- 将该框架应用于多项任务:识别模型激活触发因素、检测数据集捷径、总结文本聚类以及分析分布漂移。
- 采用概率框架将假设语义定义为众包工作者的多数投票,确保与人类判断一致。
- 利用三阶段数据收集流程:(1) 收集假设,(2) 使用 GPT-3 生成正负样本,(3) 收集人工标注以筛选和验证。
实验结果
研究问题
- RQ1经过微调和重排序的大语言模型能否生成准确捕捉两个文本分布差异的自然语言描述?
- RQ2所提出方法在识别已知数据集捷径(如否定词或超链接相关性)方面的有效性如何?
- RQ3该系统在二元文本分类任务中,能在多大程度上恢复人类标注的正类特征描述?
- RQ4该系统能否检测并描述真实世界 NLP 数据集中跨时间或数据划分的有意义分布漂移?
- RQ5该方法在模型可解释性、偏见检测和聚类总结等多样化应用中的可扩展性如何?
主要发现
- 所提方法在 54 项真实世界二分类任务的基准测试中,使用微调后的 GPT-3 Davinci(175B)和重排序,实现了 76% 的准确率,生成的描述与人工标注结果一致。
- 零样本 GPT-3 Curie(13B)仅在 7% 的情况下生成与人工标注相似的描述,凸显了微调和验证的必要性。
- 该系统成功重新发现了已知的数据集捷径,例如在 MNLI 中否定词与矛盾类之间的虚假相关性,以及在 SMS Spam 中超链接与垃圾短信之间的相关性。
- 该系统正确识别出 SUBJ 数据集是通过对比电影评论与剧情摘要构建的,这一事实被许多近期论文所忽视。
- 该方法实现了对模型行为的可解释分析,例如识别哪些输入会触发深度学习模型中的特定神经元。
- 该框架在多样化应用中具有泛化能力,包括总结文本聚类、检测分布漂移以及调试模型偏见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。