[论文解读] Can LLMs be Good Financial Advisors?: An Initial Study in Personal Decision Making for Optimized Outcomes
本研究评估了 GPT-3.5 和 Bard 在涉及信用卡、存款和支付的 13 项个人理财查询中作为金融顾问的表现,涵盖英语、非洲裔美国人英语(AAVE)和泰卢固语。尽管输出流利,但两种模型均存在严重缺陷:53.8% 的回应缺乏个性化建议,15.4% 存在数学或感知错误,92.3% 未提供视觉辅助工具,凸显其在金融决策中可靠性的担忧。
Increasingly powerful Large Language Model (LLM) based chatbots, like ChatGPT and Bard, are becoming available to users that have the potential to revolutionize the quality of decision-making achieved by the public. In this context, we set out to investigate how such systems perform in the personal finance domain, where financial inclusion has been an overarching stated aim of banks for decades. We asked 13 questions representing banking products in personal finance: bank account, credit card, and certificate of deposits and their inter-product interactions, and decisions related to high-value purchases, payment of bank dues, and investment advice, and in different dialects and languages (English, African American Vernacular English, and Telugu). We find that although the outputs of the chatbots are fluent and plausible, there are still critical gaps in providing accurate and reliable financial information using LLM-based chatbots.
研究动机与目标
- 评估基于大语言模型的聊天机器人(GPT-3.5 和 Bard)在提供个人理财决策个性化金融建议方面的可靠性与准确性。
- 研究语言差异(英语、非洲裔美国人英语(AAVE)和泰卢固语)对大语言模型生成的金融建议质量与正确性的影响。
- 识别大语言模型在处理涉及信用额度、到期日和跨产品交互的复杂金融情景时,推理、计算和信息解读中的系统性错误。
- 评估回应中缺乏视觉辅助工具和结构化数据呈现的问题,这可能影响用户对金融决策的理解。
- 突出在多样化语言和人口背景情境下部署大语言模型担任金融顾问角色所面临的重大挑战。
提出的方法
- 设计了 13 项结构化的金融查询,涵盖信用卡使用、现金返还优惠、付款到期日、信用额度、定期存款(CD)投资和银行账户余额。
- 在三种语言方言中变化查询输入:标准英语、非洲裔美国人英语(AAVE)和泰卢固语,以评估多语言性能。
- 在 13 个不同的金融决策场景中,对 GPT-3.5(ChatGPT)和 Google 的 Bard 进行评估,这些场景具有精确的数值和条件约束。
- 将错误分类为五类:缺乏个性化建议、数学错误、感知错误、语法错误和缺乏视觉辅助工具。
- 量化各类查询中的错误频率,并比较不同语言变体和查询复杂度下模型的表现。
- 使用基于约束的验证来确认正确性:例如,确保总债务 + 新购买金额 < 信用额度,并检查付款选项是否满足余额和利息条件。
实验结果
研究问题
- RQ1GPT-3.5 和 Bard 等大语言模型在涉及信用卡、存款和支付的多样化个人理财情景中,提供准确且个性化金融建议的程度如何?
- RQ2语言差异(标准英语、AAVE、泰卢固语)如何影响大语言模型生成的金融建议的准确性和流利度?
- RQ3在金融决策的大语言模型回应中,常见的系统性错误类型(如数学、感知或语法错误)有哪些?
- RQ4大语言模型在呈现金融比较或建议时,多大程度上未能包含表格或图表等视觉辅助工具?
- RQ5在多语言和多样化用户情境下,部署大语言模型担任金融顾问角色面临哪些关键挑战?
主要发现
- Bard 的 53.8% 回应和 ChatGPT 的 46.15% 回应缺乏个性化建议,表明其未能使用所有提供的用户特定数据。
- Bard 的 15.38% 回应和 ChatGPT 的 7.69% 回应包含数学或感知错误,如计算错误或对信用额度和到期日的误解。
- 15.38% 的 ChatGPT 泰卢固语回应中存在语法错误,导致难以理解,而 Bard 在泰卢固语回应中未出现此类错误。
- Bard 的 92.3% 回应和 ChatGPT 的 100% 回应缺乏表格或图表等视觉辅助工具,尽管这些工具可显著提升金融决策的清晰度。
- 两种模型在多语言支持方面均表现不佳:ChatGPT 的泰卢固语回应常不完整且语法错误多,而 Bard 的泰卢固语回应则不一致且流利度较低。
- 本研究识别出大语言模型在金融领域部署的五大挑战(C1–C5),包括响应行为随时间变化、数值推理能力差、缺乏可视化、语言支持有限以及评估中用户多样性不足。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。