[论文解读] Learning Norms from Stories: A Prior for Value Aligned Agents
本文提出通过在《Goofus & Gallant》漫画系列语料库上进行训练,学习一种价值对齐的先验,该语料库对比了规范性(Gallant)与非规范性(Goofus)行为。基于Transformer的模型在无关的叙事数据集上实现了高零样本迁移性能,表明通过故事学习到的规范可作为强大且可泛化的价值对齐先验,无需额外微调。
Value alignment is a property of an intelligent agent indicating that it can only pursue goals and activities that are beneficial to humans. Traditional approaches to value alignment use imitation learning or preference learning to infer the values of humans by observing their behavior. We introduce a complementary technique in which a value aligned prior is learned from naturally occurring stories which encode societal norms. Training data is sourced from the childrens educational comic strip, Goofus and Gallant. In this work, we train multiple machine learning models to classify natural language descriptions of situations found in the comic strip as normative or non normative by identifying if they align with the main characters behavior. We also report the models performance when transferring to two unrelated tasks with little to no additional training on the new task.
研究动机与目标
- 开发一种可泛化的机器学习先验,用于价值对齐,超越直接模仿学习的局限。
- 解决模仿学习的局限性,例如高数据需求以及训练期间产生有害行为的风险。
- 利用自然存在的故事——特别是儿童漫画——作为规范性与非规范性行为的标注来源。
- 评估在故事语料库上训练的模型是否能在无需额外标注的情况下泛化到无关任务。
- 探讨使用文化特定规范训练价值对齐AI系统的伦理影响,以及此类先验被对抗性滥用的风险。
提出的方法
- 使用《Goofus & Gallant》(G&G)漫画系列语料库作为带有明确规范性与非规范性行为标签的数据集。
- 从故事事件中提取自然语言描述,并根据角色行为将其分类为规范性或非规范性。
- 对多种机器学习模型(包括BERT和RoBERTa)在G&G语料库上进行微调,以学习规范性分类。
- 在两个无关数据集上评估零样本迁移性能:Plotto(现实日常事件)和科幻情节摘要数据集。
- 在新任务的小部分标注数据上进行微调,以评估性能提升。
- 使用标准分类指标评估模型在零样本和少样本迁移下的性能。
实验结果
研究问题
- RQ1基于Transformer的模型能否从自然存在的故事语料库中高精度地学习分类规范性与非规范性行为?
- RQ2在无需额外微调的情况下,基于Goofus & Gallant训练的模型在无关叙事领域中的泛化能力如何?
- RQ3在新任务中仅访问少量特定任务的标注数据,对故事训练模型在新任务上的性能有何影响?
- RQ4所学习的模型能否作为稳健的先验,以补充传统模仿学习在价值对齐中的应用?
- RQ5使用文化特定故事语料库训练价值对齐AI系统的伦理风险是什么?
主要发现
- 基于Transformer的模型(如BERT和RoBERTa)在Plotto和科幻叙事数据集上均实现了高零样本迁移性能,表明基于故事的规范具有强大的泛化能力。
- 零样本迁移性能显著高于非Transformer模型,Transformer模型的性能大幅领先。
- 在仅使用少量新任务标注样本进行微调后,模型准确率显著提升,几乎达到在原始Goofus & Gallant数据集上的表现。
- 表现最佳的模型在未见的G&G故事描述中对规范性行为的分类准确率很高,表明其有效学习了语料库中的内容。
- 结果表明,基于故事的语料库可作为强大且可重用的价值对齐先验,减少对昂贵示范的依赖。
- 本研究凸显了所学规范的文化特定性,因为G&G语料库反映了美国社会价值观,提示可使用其他文化背景的类似数据集来训练文化适配的先验。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。