[论文解读] Few-shot Language Coordination by Modeling Theory of Mind
本文提出了一种少样本语言协调框架,其中说话者智能体通过建模听者的心理理论(ToM)来实时自适应生成指令。通过元学习预测听者行为,该模型在指代游戏和语言导航任务中通过显式推理听者的信念,提升了沟通效率,在少样本适应场景下优于非ToM基线模型。
$ extit{No man is an island.}$ Humans communicate with a large community by coordinating with different interlocutors within short conversations. This ability has been understudied by the research on building neural communicative agents. We study the task of few-shot $ extit{language coordination}$: agents quickly adapting to their conversational partners' language abilities. Different from current communicative agents trained with self-play, we require the lead agent to coordinate with a $ extit{population}$ of agents with different linguistic abilities, quickly adapting to communicate with unseen agents in the population. This requires the ability to model the partner's beliefs, a vital component of human communication. Drawing inspiration from theory-of-mind (ToM; Premack& Woodruff (1978)), we study the effect of the speaker explicitly modeling the listeners' mental states. The speakers, as shown in our experiments, acquire the ability to predict the reactions of their partner, which helps it generate instructions that concisely express its communicative goal. We examine our hypothesis that the instructions generated with ToM modeling yield better communication performance in both a referential game and a language navigation task. Positive results from our experiments hint at the importance of explicitly modeling communication as a socio-pragmatic progress.
研究动机与目标
- 为弥合多智能体通信研究中的空白,即智能体通常通过自对弈进行训练,却无法适应新伙伴。
- 研究少样本语言协调作为一种现实场景,其中智能体必须快速适应具有不同语言能力的未见听者。
- 探究显式建模听者的心理状态(心理理论)是否能提升在动态、多轮交互中的通信性能。
- 开发一种说话者智能体,利用信念追踪预测听者行为,并实时选择最优指令。
- 在视觉-语言导航和指代游戏任务中证明心理理论建模的有效性,展示其在适应性和性能上的提升。
提出的方法
- 说话者智能体使用模型无关的元学习(MAML)方法,通过预测不同指令下听者的可能行为,快速适应新听者。
- 在每个时间步,说话者基于先前互动和可能的指令,维护对听者可能下一步行为的信念状态。
- 心理理论模型经过训练,可预测不同语言能力听者的行为,使说话者能够选择使正确行为概率最大化的指令。
- 说话者基于预测的信念状态,选择能使听者执行正确行为概率最大的指令。
- 该框架在两种场景中进行评估:多语言指代游戏和语言导航任务,性能通过成功率和指令效率进行衡量。
- 心理理论模型在指令生成过程中充当重排序器,通过显式建模社会语用推理提升决策质量。
实验结果
研究问题
- RQ1说话者智能体是否能在仅几次互动内有效适应具有不同语言能力的新听者?
- RQ2显式建模听者的心理理论是否能提升在少样本协调任务中的通信性能?
- RQ3与非ToM基线相比,基于心理理论的信念追踪在指令效率和成功率方面表现如何?
- RQ4该模型能否在多样化听者类型间泛化,并在动态、多轮交互中保持准确的信念状态?
- RQ5心理理论建模在多大程度上增强了智能体实时纠正误解和调整指令层级的能力?
主要发现
- 基于心理理论的说话者模型在指代游戏和语言导航任务中显著优于非ToM基线,展现出更优的少样本适应能力。
- 通过选择更简洁有效的指令,如在适当情况下选择'无指令'而非冗余命令,模型实现了更高的成功率。
- 说话者能够检测听者误解(如将'cool'误认为目的地),并通过提供更低层级的指令纠正轨迹。
- 心理理论模型以高精度预测了听者行为,从而优化了指令选择,减少了因误解导致的错误。
- 元学习的使用使模型能够泛化至未见过的听者,在零样本协调场景中表现出鲁棒性。
- 实证结果证实,通过心理理论显式建模社会语用推理,可显著提升动态交互场景下的沟通效率与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。