Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Character Understanding in Movies as an Assessment to Meta-Learning of Theory-of-Mind

Mo Yu, Wang, Qiujing|arXiv (Cornell University)|Nov 9, 2022
Topic Modeling被引用 4
一句话总结

本论文提出了 ToM-in-AMC,这是首个基于电影剧本的自然主义叙事理解中评估少样本元学习理论思维(ToM)能力的基准。它提出了一种新颖的 ToM 提示框架,显式建模信念、欲望、意图和情感等多个 ToM 维度,实现了最先进性能,但仍落后于人类表现超过20%,揭示了当前大语言模型和元学习模型在 ToM 能力方面存在关键差距。

ABSTRACT

When reading a story, humans can quickly understand new fictional characters with a few observations, mainly by drawing analogies to fictional and real people they already know. This reflects the few-shot and meta-learning essence of humans' inference of characters' mental states, i.e., theory-of-mind (ToM), which is largely ignored in existing research. We fill this gap with a novel NLP dataset, ToM-in-AMC, the first assessment of machines' meta-learning of ToM in a realistic narrative understanding scenario. Our dataset consists of ~1,000 parsed movie scripts, each corresponding to a few-shot character understanding task that requires models to mimic humans' ability of fast digesting characters with a few starting scenes in a new movie. We propose a novel ToM prompting approach designed to explicitly assess the influence of multiple ToM dimensions. It surpasses existing baseline models, underscoring the significance of modeling multiple ToM dimensions for our task. Our extensive human study verifies that humans are capable of solving our problem by inferring characters' mental states based on their previously seen movies. In comparison, our systems based on either state-of-the-art large language models (GPT-4) or meta-learning algorithms lags >20% behind, highlighting a notable limitation in existing approaches' ToM capabilities.

研究动机与目标

  • 为解决在叙事理解中评估机器元学习理论思维(ToM)缺乏真实、少样本基准的问题。
  • 评估模型是否能仅通过少量初始场景,快速推断角色的心理状态(信念、欲望、意图、情感),以模拟人类的少样本泛化能力。
  • 开发一个全面的评估框架,捕捉 ToM 的多个维度,超越静态人格分类或对话生成等传统任务。
  • 识别并量化当前最先进模型(如 GPT-4、元学习算法)在真实故事语境中推理复杂动态角色心理状态方面的局限性。
  • 通过利用电影剧本作为自然且丰富的叙事推理任务来源,建立 NLP 领域 ToM 评估的新标准。

提出的方法

  • 作者构建了一个约1,000部解析后电影剧本的数据集,每部剧本均仅使用前几幕场景作为上下文,转化为一个少样本角色理解任务。
  • 每个任务要求模型根据极少数先前接触的信息,从匿名化说话者中识别出某段对话的说话人,以模拟人类的少样本推理过程。
  • 提出一种新颖的 ToM 提示方法,显式评估并锚定在信念、欲望、意图和情感四个 ToM 维度上的推理过程。
  • 该方法采用结构化提示,引导模型对角色心理状态进行推理,特别强调基于对相似角色的先验知识进行类比推理。
  • 数据集被划分为元训练集和元测试集,支持元学习评估,即模型在仅观察少量初始场景后,需泛化到新电影中的角色。
  • 性能通过人工评估和与强基线模型的对比进行评估,包括使用上下文学习的 GPT-4 和元学习模型(如 ProtoNet 和 LEOPARD)

实验结果

研究问题

  • RQ1模型能否像人类一样,仅通过少量初始场景,借助对相似角色的先验知识,泛化到新叙事角色?
  • RQ2当前的大语言模型(如 GPT-4)和元学习算法在叙事语境中在多大程度上能捕捉多维理论思维推理?
  • RQ3不同叙事类型和说话人数如何影响少样本角色理解任务的难度?
  • RQ4在从极简叙事输入中推断复杂角色心理状态方面,人类推理与机器模型之间的性能差距有多大?
  • RQ5一种显式建模信念、欲望、意图和情感的结构化 ToM 提示框架,能否显著提升模型在少样本角色理解任务上的表现?

主要发现

  • 人类在 ToM-in-AMC 基准上的表现比所有测试模型高出20%以上,表明当前模型在理论思维能力方面存在显著差距。
  • 所提出的 ToM 提示方法优于现有基线,证明显式建模多个 ToM 维度对叙事推理至关重要。
  • 使用上下文学习(ICL)的 GPT-4 表现强劲(在双人对话场景中达到86.5%),但仍落后于人类表现,尤其在戏剧和恐怖片等复杂类型中更为明显。
  • 性能在不同类型间差异显著:冒险类(98.4%)和浪漫类(94.7%)得分最高,而戏剧类(91.8%)和喜剧类(86.3%)最低,表明类型相关推理挑战的存在。
  • 随着说话人数增加,性能差距扩大:GPT-4 ToMPro 在单人场景中达到90.0%,在四人场景中下降至82.1%,五人场景中回升至90.0%,表明存在可扩展性问题。
  • 研究证实,模型常无法从上下文中推断出全局角色特征(如技术专长),如《黑客帝国》中的案例所示,模型错失了 Taylor 作为熟练特工的身份。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。