[论文解读] Goal Driven Discovery of Distributional Differences via Language Descriptions
本文提出了 D5,一个以目标为导向的自然语言生成任务,可自动发现基于用户指定探索目标的两组文本语料之间的相关差异。通过诊断基准(SynD5)和真实世界元数据集(OpenD5),作者表明语言模型能够生成有效且与目标相关的发现——相比非目标条件基线,相关性提升31%,准确率提升12%——同时在医疗、政治和自然语言处理等领域的发现中揭示了新颖见解。
Mining large corpora can generate useful discoveries but is time-consuming for humans. We formulate a new task, D5, that automatically discovers differences between two large corpora in a goal-driven way. The task input is a problem comprising a research goal "$ extit{comparing the side effects of drug A and drug B}$" and a corpus pair (two large collections of patients' self-reported reactions after taking each drug). The output is a language description (discovery) of how these corpora differ (patients taking drug A "$ extit{mention feelings of paranoia}$" more often). We build a D5 system, and to quantitatively measure its performance, we 1) contribute a meta-dataset, OpenD5, aggregating 675 open-ended problems ranging across business, social sciences, humanities, machine learning, and health, and 2) propose a set of unified evaluation metrics: validity, relevance, novelty, and significance. With the dataset and the unified metrics, we confirm that language models can use the goals to propose more relevant, novel, and significant candidate discoveries. Finally, our system produces discoveries previously unknown to the authors on a wide range of applications in OpenD5, including temporal and demographic differences in discussion topics, political stances and stereotypes in speech, insights in commercial reviews, and error patterns in NLP models.
研究动机与目标
- 将探索性文本分析形式化为以目标为导向的自然语言生成任务(D5),以发现两组语料之间的有意义差异。
- 解决文本语料中开放性、以目标为导向的发现缺乏标准化评估的问题。
- 开发并评估一种利用语言模型基于用户指定目标生成有效且相关发现的系统。
- 构建诊断性和开放性评估框架——SynD5 和 OpenD5——以评估 D5 系统在合成和真实世界问题中的表现。
- 实现在大规模文本语料中自动化、可扩展地发现分布差异,包括人口统计、政治立场和 NLP 错误模式等先前未知的模式。
提出的方法
- 将 D5 形式化为自然语言生成任务:输入为一个目标和两组语料分割(探索集与验证集),输出为描述有效且相关差异的自然语言谓词。
- 构建 SynD5,一个包含 1,000 个合成 D5 问题的诊断基准,其中已知真实差异,支持对发现准确率的自动化评估。
- 构建 OpenD5,一个包含 675 个真实世界、开放性 D5 问题的元数据集,涵盖医疗、社会科学和 NLP 等领域,包含 440 万个文本样本。
- 训练并评估一个以目标为条件的语言模型,利用探索目标引导关于语料差异的假设生成。
- 设计一种自监督学习方法,利用 OpenD5(无参考答案)提升模型在生成有效假设方面的性能。
- 对 OpenD5 输出的子集进行人工评估,以评估相关性和有效性,提供关于实际应用价值的定性洞察。

实验结果
研究问题
- RQ1语言模型能否有效利用用户指定的目标,生成关于两组文本语料差异的有效且相关的发现?
- RQ2与非目标条件基线相比,目标条件化如何提升 D5 系统的性能?
- RQ3D5 系统在多大程度上能够发现真实语料中此前未知的新颖差异?
- RQ4当前评估指标在促进多样性、因果性或基于专家知识的发现方面存在哪些局限?
- RQ5在大规模 D5 问题库上进行自监督学习,能否在无需人工标注参考答案的情况下提升生成发现的有效性?
主要发现
- 在 SynD5 诊断基准上,目标条件化的 D5 系统相比非目标条件基线,恢复已知差异的准确率提高了 12%。
- 在 OpenD5 元数据集上,目标条件化系统生成相关候选发现的频率比非目标条件基线高出 31%。
- 该系统发现了新颖的、此前未知的模式,包括讨论主题中的年龄与性别差异、演讲中的政治立场差异,以及 NLP 模型中的错误模式。
- 人工评估证实,该系统在医疗、商业和社交媒体等多样化领域中均能生成有意义且上下文相关的发现。
- 评估指标揭示了其局限性:无法鼓励多样性,无法评估因果性声明,且在需要深度专家知识的发现上表现不佳。
- 在 OpenD5 上进行自监督微调,提升了模型生成有效假设的能力,证明了无需标准参考答案即可进行训练的可行性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。