Skip to main content
QUICK REVIEW

[论文解读] Open the Chests: An Environment for Activity Recognition and Sequential Decision Problems Using Temporal Logic

Benjamin Beyret, José Hernández‐Orallo|arXiv (Cornell University)|Sep 12, 2019
Reinforcement Learning in Robotics参考文献 27被引用 35
一句话总结

本文介绍了Animal-AI环境,这是一个基于物理的开源平台,旨在通过物体恒存性、因果推理和空间推理等动物类认知能力来评估人工智能智能体。受比较心理学的启发,该平台采用基于时间逻辑和物理仿真的结构化任务,测试模型的泛化能力和理解能力,在10个认知类别中实现了约40%的最先进AI性能。

ABSTRACT

Recent advances in artificial intelligence have been strongly driven by the use of game environments for training and evaluating agents. Games are often accessible and versatile, with well-defined state-transitions and goals allowing for intensive training and experimentation. However, agents trained in a particular environment are usually tested on the same or slightly varied distributions, and solutions do not necessarily imply any understanding. If we want AI systems that can model and understand their environment, we need environments that explicitly test for this. Inspired by the extensive literature on animal cognition, we present an environment that keeps all the positive elements of standard gaming environments, but is explicitly designed for the testing of animal-like artificial cognition.

研究动机与目标

  • 通过创建一个评估泛化能力和理解能力而非仅特定任务表现的测试平台,解决AI领域中能力导向基准的缺乏问题。
  • 通过借鉴比较心理学中既有的实验范式,弥合AI评估与动物认知研究之间的差距。
  • 设计一个强调认知推理、物理理解及长期记忆而非模式识别的训练与测试环境。
  • 提供一个可扩展的开源平台,通过统一且模块化的框架,评估智能体在多样化认知技能上的表现。
  • 通过实现认知能力的解耦,促进AI与比较认知科学社区之间的合作。

提出的方法

  • 该环境基于具有确定性状态转移函数的物理仿真引擎构建,支持可重现且复杂的交互。
  • 包含七种类别的物体,包括奖励(食物)、方块和障碍物,支持构建多样化的认知任务。
  • 任务被划分为10个认知类别,例如偏好、物体恒存性、因果推理,每类测试一种特定的认知能力。
  • 每个任务均设计为动物可解决但当前AI难以应对,使用时间逻辑定义目标条件。
  • 平台支持零样本泛化,通过在未见过的任务变体上测试智能体,且不允许重新训练。
  • Animal-AI奥运会竞赛利用此测试平台,在所有10个类别中评估智能体,生成超越单一分数的性能画像。

实验结果

研究问题

  • RQ1AI智能体能否在需要直觉物理、物体恒存性和因果推理的任务上达到人类水平表现,如动物认知中所见?
  • RQ2单个智能体在无需重新训练的情况下,能在多大程度上泛化到多种非相同认知任务?
  • RQ3与任务导向基准相比,当前深度强化学习方法在能力导向基准上的表现如何?
  • RQ4结构化、受心理学启发的任务能否揭示当前AI泛化与推理能力的根本局限?
  • RQ5如何通过模块化、多类别基准实现智能体的认知画像?

主要发现

  • 当前最先进AI在Animal-AI测试平台上的表现约为40%,表明在认知泛化方面仍有显著提升空间。
  • 基于导航和奖励选择的任务更容易解决,某些情况下性能接近80%,与传统强化学习的优势一致。
  • 需要内部世界建模、物体恒存性和因果推理的任务显著更难,最复杂变体的性能低于30%。
  • 顶尖竞争者的雷达图显示各类别间存在明显性能差异,偏好和障碍物任务表现良好,但内部模型和因果推理任务表现薄弱。
  • 该平台成功识别出在标准DRL基准上训练的智能体无法泛化到需要长期记忆或物理推理的任务。
  • 结果表明,当前AI系统缺乏对环境的稳健内部模型,且在推理未知或隐藏状态方面存在困难,这与动物认知中的已知局限性一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。