[论文解读] A Decision-Language Model (DLM) for Dynamic Restless Multi-Armed Bandit Tasks in Public Health
本文提出了一种决策-语言模型(DLM),该模型利用大语言模型(LLMs)在躁动多臂老虎机(RMAB)框架中动态调整奖励函数,以实现公共卫生资源的分配。通过解析人类语言的政策指令,并利用RMAB仿真反馈迭代优化奖励函数,DLM在无需微调的情况下实现了接近人类水平的策略对齐,从而能够实时适应不断变化的公共卫生优先事项。
Restless multi-armed bandits (RMAB) have demonstrated success in optimizing resource allocation for large beneficiary populations in public health settings. Unfortunately, RMAB models lack flexibility to adapt to evolving public health policy priorities. Concurrently, Large Language Models (LLMs) have emerged as adept automated planners across domains of robotic control and navigation. In this paper, we propose a Decision Language Model (DLM) for RMABs, enabling dynamic fine-tuning of RMAB policies in public health settings using human-language commands. We propose using LLMs as automated planners to (1) interpret human policy preference prompts, (2) propose reward functions as code for a multi-agent RMAB environment, and (3) iterate on the generated reward functions using feedback from grounded RMAB simulations. We illustrate the application of DLM in collaboration with ARMMAN, an India-based non-profit promoting preventative care for pregnant mothers, that currently relies on RMAB policies to optimally allocate health worker calls to low-resource populations. We conduct a technology demonstration in simulation using the Gemini Pro model, showing DLM can dynamically shape policy outcomes using only human prompts as input.
研究动机与目标
- 解决在不重新训练的前提下,将基于RMAB的公共卫生资源分配方案适应不断变化的政策优先事项的挑战。
- 使非专家公共卫生从业者能够通过自然语言指令指定期望结果。
- 开发一个反馈循环,利用RMAB环境中的仿真结果改进大语言模型生成的奖励函数。
- 在印度ARMMAN的母孕及儿童健康干预实际场景中验证该方法。
- 证明大语言模型能够有效生成并优化复杂、动态的公共卫生决策中的奖励函数。
提出的方法
- 利用大语言模型解析人类政策偏好提示,并提取用于期望健康结果的语义意图。
- 利用大语言模型的代码生成能力,将自然语言转换为基于代码的奖励函数。
- 实施一个迭代优化循环,利用RMAB仿真结果为大语言模型生成的奖励函数提供反馈以持续改进。
- 采用基于仿真的反馈机制,使大语言模型生成的奖励函数与目标政策目标对齐,而无需真实标签反馈。
- 将大语言模型生成的奖励函数集成到多智能体强化学习环境中,用于训练RMAB的自适应分配策略。
- 通过一个真实世界的孕产妇健康项目对系统进行验证,其中健康工作者在资源受限条件下为孕妇受益人分配电话联系。

实验结果
研究问题
- RQ1大语言模型能否有效解析自然语言政策指令,并将其转化为公共卫生RMAB中可执行的奖励函数?
- RQ2利用RMAB仿真结果的迭代反馈循环能否提升大语言模型生成的奖励函数与期望政策结果的对齐程度?
- RQ3大语言模型生成的奖励函数在动态公共卫生分配任务中,其性能在多大程度上可与人工设计的奖励函数相媲美?
- RQ4DLM系统在真实世界的孕产妇健康干预场景中,对优先事项变化的适应能力如何?
- RQ5该系统能否使非专家用户仅通过自然语言输入即可动态调整公共卫生政策?
主要发现
- DLM系统成功将自然语言政策指令转化为有效的奖励函数,引导RMAB策略实现期望结果。
- 迭代反馈循环显著提升了大语言模型生成奖励函数的质量,使其能够收敛至目标政策目标。
- 通过仿真结果衡量,DLM在奖励函数设计方面实现了接近人类水平的性能,与专家设计的基准表现一致。
- 该系统实现了无需重新训练的动态策略适应,可快速响应公共卫生优先事项的变化。
- 在ARMMAN案例研究中,DLM展示了根据不断变化的受益人风险特征和时间偏好,有效重新分配有限的健康工作者资源。
- 该方法减少了对专家干预在奖励函数工程中的依赖,使基于RMAB的规划对非技术背景的公共卫生从业者更加可及。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。