[论文解读] Navigation Turing Test (NTT): Learning to Evaluate Human-Like Navigation
本文提出了自动导航图灵测试(ANTT),一种机器学习框架,通过六种分类架构预测人类对导航行为类人程度的判断。该框架在区分人类与智能体轨迹方面表现优异,但在智能体之间的细微比较上表现不佳,凸显了建模细微类人特征的关键挑战。
A key challenge on the path to developing agents that learn complex human-like behavior is the need to quickly and accurately quantify human-likeness. While human assessments of such behavior can be highly accurate, speed and scalability are limited. We address these limitations through a novel automated Navigation Turing Test (ANTT) that learns to predict human judgments of human-likeness. We demonstrate the effectiveness of our automated NTT on a navigation task in a complex 3D environment. We investigate six classification models to shed light on the types of architectures best suited to this task, and validate them against data collected through a human NTT. Our best models achieve high accuracy when distinguishing true human and agent behavior. At the same time, we show that predicting finer-grained human assessment of agents' progress towards human-like behavior remains unsolved. Our work takes an important step towards agents that more effectively learn complex human-like behavior.
研究动机与目标
- 解决基于人类评估在评估类人导航行为时面临的可扩展性和速度限制。
- 开发一种可扩展至强化学习智能体训练迭代过程的类人判断自动化代理。
- 识别哪些神经网络架构最能捕捉导航轨迹中的类人特征。
- 通过人类标注的类人图灵测试(HNTT)验证自动化系统的有效性。
- 探究当前模型是否能捕捉超越简单类人与非类人区分的细微类人程度梯度。
提出的方法
- 在人类玩家和强化学习智能体的轨迹数据上,训练六种分类模型——两种符号模型、两种视觉模型和两种混合模型。
- 使用五折交叉验证对测试轨迹的独立数据进行训练和超参数调优。
- 通过多数投票法在轨迹层面聚合模型预测结果,以提升鲁棒性。
- 将模型输出与两类人类判断进行对比:人类 vs. 智能体,以及符号模型 vs. 混合模型智能体对。
- 采用身份准确率(区分人类/智能体)和斯皮尔曼等级相关系数(用于相对类人程度排序)评估性能。
- 利用人类标注的类人图灵测试(HNTT)作为真实标签,验证自动化 ANTT 系统。
实验结果
研究问题
- RQ1自动化模型能否准确预测人类对导航行为类人程度的判断?
- RQ2哪些模型架构在学习区分人类与智能体轨迹方面最为有效?
- RQ3自动化模型在捕捉不同智能体之间的相对类人程度方面表现如何,而不仅仅是二元的人类 vs. 智能体分类?
- RQ4符号模型和视觉模型在未见轨迹上的泛化能力如何?
- RQ5当前模型在捕捉细微类人判断方面存在哪些局限性?
主要发现
- 所有模型在保留的测试数据上泛化良好,身份准确率在 0.583(TD-CNN)至 0.850(符号模型)之间。
- 符号模型与人类判断的吻合度最高,尤其在区分人类与智能体轨迹方面表现突出。
- 斯皮尔曼等级相关系数显示,人类与智能体比较中存在中等到高度的一致性,尤其在符号模型和自顶向下 CNN 模型中表现更佳。
- 在混合-符号智能体对上的排序性能较差,出现负相关且方差较高,表明对细微类人程度的捕捉能力不足。
- 尽管二元分类准确率较高,但当前模型仍无法可靠地将智能体沿类人程度谱系进行排序,表明该问题仍为开放挑战。
- 结果表明,符号表示可能比更丰富的视觉特征更符合人类判断机制,这与预期相反。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。