[论文解读] Large Language Models for Travel Behavior Prediction
本研究提出了一种基于大语言模型(LLMs)的零样本提示框架,用于在无需训练数据的情况下预测出行方式选择,该框架利用任务描述、个体属性、出行特征以及领域引导的推理。与传统的多项式logit模型、随机森林和神经网络相比,LLMs在准确率和F1分数方面表现具有竞争力,同时生成可解释的说明——尽管偶尔会出现幻觉和推理错误。
Travel behavior prediction is a core problem in transportation demand management and is traditionally addressed using numerical models calibrated on observed data. With recent advances in large language models (LLMs), new opportunities have emerged to model human decision-making through natural language reasoning. This study explores the use of LLMs for travel behavior prediction through two complementary frameworks. The first framework employs a zero-shot prompting strategy, where the prediction task, traveler attributes, and relevant domain knowledge are described in text, enabling the LLM to directly generate predictions without task-specific training data. The second framework uses LLM-generated text embeddings as high-level representations of travel scenarios, which are then combined with conventional supervised learning models to support prediction in small-sample settings. Empirical results show that both approaches achieve performance comparable to, and in some cases competitive with, classical models such as multinomial logit, random forest, and neural networks. These findings suggest that LLMs offer a flexible and data-efficient alternative for travel behavior prediction.
研究动机与目标
- 探究大语言模型(LLMs)是否可以在不依赖训练数据或参数校准的情况下预测出行行为。
- 开发一种零样本提示框架,整合任务描述、个体属性、出行特征和领域知识,用于出行方式选择预测。
- 评估基于LLM的预测性能与经典监督学习模型(如多项式logit、随机森林和神经网络)的对比表现。
- 考察LLM生成说明的可解释性和推理质量在出行行为预测中的表现。
- 识别LLM输出在交通决策任务中出现的局限性,如幻觉和逻辑不一致。
提出的方法
- 设计一种包含四个要素的零样本提示:任务描述、个体属性(例如,经常乘坐火车的用户、年票持有者)、出行特征(各出行方式的时间和成本)、以及领域引导的推理提示。
- 使用大语言模型(如GPT-4)基于工程化的提示生成预测和说明,完全不依赖微调或训练数据。
- 将预测任务视为推理问题,引导LLM利用交通领域的知识权衡时间与成本的取舍。
- 使用标准指标(如准确率和F1分数)评估模型性能,并将LLM输出与经典模型的预测结果进行比较。
- 对LLM生成的说明进行定性分析,以评估其逻辑一致性、相关性以及是否存在幻觉。
- 使用真实世界调查数据进行测试和验证,确保该框架建立在实证出行行为的基础之上。
实验结果
研究问题
- RQ1LLMs是否可以在不使用任何训练数据或参数学习的情况下,实现与现有模型相当的预测性能?
- RQ2LLM生成的说明在质量与合理性方面,与经典模型的预测相比如何?
- RQ3基于LLM的出行行为预测中,会出现哪些类型的推理错误或幻觉?
- RQ4提示工程在引导LLM做出准确且可解释的出行行为决策方面有多有效?
- RQ5该LLM框架是否可推广至出行方式选择以外的其他出行行为预测任务?
主要发现
- 尽管未使用任何训练数据,基于LLM的预测在准确率和F1分数方面与多项式logit、随机森林和神经网络相比表现具有竞争力。
- 在大多数情况下,LLM生成了合理且与上下文相关的说明,例如当出行时间差异显著时,优先考虑时间节省。
- 在某些情况下,LLM因推理有误而产生错误预测,例如声称某人偏好时间节省而非成本节省,但输入数据中并无支持依据。
- 当LLM虚构偏好时观察到幻觉现象,例如在输入数据显示相反情况时,断言某人因时间节省而偏好瑞士磁悬浮列车。
- 在一种情况下,由于错误理解了个人作为常规乘客的身份状态及缺乏年票,模型错误地预测选择火车,尽管瑞士磁悬浮在时间和成本上均为最优。
- 该框架实现了从数据驱动建模到基于推理预测的范式转变,无需重新训练模型即可提供可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。