[论文解读] OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
OpenToM 是一个用于评估大语言模型(LLMs)中神经理论-心智(N-ToM)推理的新基准,其特点为自然、拟人化的叙事,包含有意图的行为、明确的人格特质,以及针对物理世界和心理心智状态的多样化问题。研究发现,尽管 LLMs 在物理世界推理方面表现尚可,但在心理状态追踪方面显著表现不佳,暴露出其社会认知能力中的关键缺陷。
Neural Theory-of-Mind (N-ToM), machine's ability to understand and keep track of the mental states of others, is pivotal in developing socially intelligent agents. However, prevalent N-ToM benchmarks have several shortcomings, including the presence of ambiguous and artificial narratives, absence of personality traits and preferences, a lack of questions addressing characters' psychological mental states, and limited diversity in the questions posed. In response to these issues, we construct OpenToM, a new benchmark for assessing N-ToM with (1) longer and clearer narrative stories, (2) characters with explicit personality traits, (3) actions that are triggered by character intentions, and (4) questions designed to challenge LLMs' capabilities of modeling characters' mental states of both the physical and psychological world. Using OpenToM, we reveal that state-of-the-art LLMs thrive at modeling certain aspects of mental states in the physical world but fall short when tracking characters' mental states in the psychological world.
研究动机与目标
- 为解决现有 N-ToM 基准的不足,例如人为编写的叙事、缺乏人格特征以及意图模糊等问题。
- 开发一个全面的基准,用于评估 LLM 在物理世界和心理世界中推理角色心智状态的能力。
- 使用四阶段、LLM 增强、人工参与的流水线,生成高质量、经人工验证的叙事,以减少虚假线索并提升真实性。
- 评估最先进 LLM 在心理推理任务中的表现,识别 N-ToM 能力中持续存在的局限性。
提出的方法
- 采用四阶段人工参与流水线:(1) 为角色分配人格特质和偏好,(2) 定义意图及相应行为(即行为实现),(3) 使用 LLM 生成自然叙事,(4) 通过人工标注者对故事进行润色,以确保清晰性和连贯性。
- 设计包含两名主角、一个关注对象和多个地点的叙事,确保行为由角色意图和人格驱动。
- 每则故事构建三种问题类型:(1) 位置相关问题(Loc),(2) 多跳推理问题(MHop),(3) 态度相关问题(Att),用于探测心理状态。
- 在多种 LLM(如 GPT-4、Llama2、Mixtral)上进行零样本评估,并测试如思维链(Chain-of-Thought)和模拟-理论-心智(Simulated-ToM)等提示工程技术。
- 微调一个 Llama2-Chat-13B 模型,以建立微调基线用于对比。
- 应用严格的缓解策略,以减少词法重叠等虚假相关性,确保对真实 N-ToM 推理的有效评估。
实验结果
研究问题
- RQ1LLMs 在多大程度上能基于叙事语境和角色意图准确预测实体在物理世界中的位置?
- RQ2LLMs 在复杂社会叙事中,对角色心理状态(如态度、信念和情感反应)的推理能力如何?
- RQ3与基于模板的基准相比,人格特质和有意图行为的引入是否能提升 LLM 在理论-心智推理任务中的表现?
- RQ4先进的提示技术(如思维链、SimToM)以及微调如何影响 LLM 建模心理心智状态的能力?
- RQ5LLMs 在 N-ToM 推理中的关键失败模式是什么,特别是不忠实推理、对叙事长度的敏感性以及角色模糊性方面?
主要发现
- 最先进 LLM(包括 GPT-4 和微调后的 Llama2-13B)在物理世界推理(如物体位置)方面表现优异,但在心理状态问题上性能显著下降。
- LLMs 展现出明显的推理能力错配:在物理世界感知方面表现强劲,但在心理状态建模方面表现薄弱,表明其社会认知存在根本性缺陷。
- 即使采用先进提示技术(如思维链和 SimToM),LLMs 仍无法一致地推断出角色的态度或信念,表明其在心智状态追踪方面存在固有局限。
- 模型在推理中表现出不忠实性,常生成看似合理但与叙事逻辑或角色心理不符的错误解释。
- 性能对叙事长度和角色身份敏感,当角色身份模糊或叙事更长更复杂时,模型表现更差。
- 该基准表明,当前 LLM 容易依赖虚假线索,即使在精心构建的、拟人化的叙事中,也难以理解细微的心理感知。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。