[论文解读] A Theoretically Grounded Benchmark for Evaluating Machine Commonsense
本文提出了理论基础常识推理(TG-CSR),这是首个基于戈登-霍布斯常识语义理论的机器常识推理(CSR)评估基准。它采用少样本、上下文和主题特定的问答任务,涵盖九种类别语义——如时间、空间、情感和目标——实现了严格的语义评估,通过分阶段、逐步增加难度的发布方式有效防止过拟合。初步结果显示,即使大型语言模型在超越统计模式的语义严谨性方面也面临挑战。
Programming machines with commonsense reasoning (CSR) abilities is a longstanding challenge in the Artificial Intelligence community. Current CSR benchmarks use multiple-choice (and in relatively fewer cases, generative) question-answering instances to evaluate machine commonsense. Recent progress in transformer-based language representation models suggest that considerable progress has been made on existing benchmarks. However, although tens of CSR benchmarks currently exist, and are growing, it is not evident that the full suite of commonsense capabilities have been systematically evaluated. Furthermore, there are doubts about whether language models are 'fitting' to a benchmark dataset's training partition by picking up on subtle, but normatively irrelevant (at least for CSR), statistical features to achieve good performance on the testing partition. To address these challenges, we propose a benchmark called Theoretically-Grounded Commonsense Reasoning (TG-CSR) that is also based on discriminative question answering, but with questions designed to evaluate diverse aspects of commonsense, such as space, time, and world states. TG-CSR is based on a subset of commonsense categories first proposed as a viable theory of commonsense by Gordon and Hobbs. The benchmark is also designed to be few-shot (and in the future, zero-shot), with only a few training and validation examples provided. This report discusses the structure and construction of the benchmark. Preliminary results suggest that the benchmark is challenging even for advanced language representation models designed for discriminative CSR question answering tasks. Benchmark access and leaderboard: https://codalab.lisn.upsaclay.fr/competitions/3080 Benchmark website: https://usc-isi-i2.github.io/TGCSR/
研究动机与目标
- 为以语义严谨的方式评估机器常识推理(CSR)提供理论基础的基准。
- 克服现有临时性、统计偏差的CSR基准的局限性,这些基准未能捕捉真正的语义理解。
- 设计一个通过分四阶段逐步增加难度发布数据(包括最终的零样本阶段)来防止过拟合的基准。
- 基于戈登-霍布斯理论,建立一个正式的、基于本体的常识类别分类体系,以指导问题和答案的构建。
- 通过竞赛式排行榜实现可持续的公开评估,以支持长期基准测试和模型开发。
提出的方法
- 该基准采用少样本问答(QA)任务的形式,每个问题均基于戈登-霍布斯理论中的特定语义类别(如“情感”或“时间”)。
- 每个QA实例均关联一个上下文(例如,“计划一次国外度假”)和一个主题(例如,“航班延误”),为问题提供上下文基础。
- 问题基于九个核心常识类别的正式分类体系构建,确保语义一致性并减少标注中的歧义。
- 该基准分四个阶段发布:第一阶段包含带标签的训练集、验证集和测试集;后续阶段逐步减少训练数据,最终进入无标签示例的零样本阶段。
- 使用提示模板以零样本方式评估生成式语言模型,答案通过与真实答案选项的完全匹配或近似匹配进行评估。
- 通过人工审核流程评估生成答案的合理性及其与语义类别的契合度,即使答案未匹配预设选项也予以评估。
实验结果
研究问题
- RQ1基于正式常识语义理论的基准是否能比临时性基准更系统、更可靠地评估机器常识推理?
- RQ2当问题在“情感”或“日程安排”等类别中具有语义基础时,其表现与纯粹基于统计模式匹配的表现相比如何?
- RQ3当在语义基础扎实的基准(如TG-CSR)上评估时,大型语言模型在多大程度上无法超越统计线索进行泛化?
- RQ4即使未提供预设选项,生成式语言模型是否仍能生成合理、类人的答案?这些答案与真实语义类别相比表现如何?
- RQ5分阶段发布策略在防止过拟合方面有多有效,能否确保模型依赖语义理解而非数据集特定的特征?
主要发现
- TG-CSR 基准是首个系统性地将问答实例基于正式常识语义理论(特别是戈登-霍布斯语义类别)的基准。
- 即使在十亿参数规模的语言模型上,TG-CSR 的表现仍显著低于人类水平,表明当前模型可能依赖统计线索而非语义理解。
- 生成式模型常输出未包含在预设选项中的合理答案,表明其在答案扩展或数据增强方面具有潜力。
- 大量模型输出被标记为“否”,即使人工标注者判断为“是”,表明在少样本设置下模型推理存在系统性偏差。
- 分阶段发布策略(包括最终的零样本阶段)成功缓解了过拟合问题,促使模型学习语义模式而非记忆训练数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。