[论文解读] LOLA: LLM-Assisted Online Learning Algorithm for Content Experiments
LOLA 是一种新颖的在线学习算法,将大型语言模型(LLMs)与上置信度界(UCB)多臂赌博机算法相结合,实现实时内容分发的优化。通过结合基于 LLM 的标题排名与自适应流量分配,LOLA 降低了遗憾值,并优于标准 A/B 测试、纯赌博机方法以及独立的 LLM,在低流量或高臂场景中显著提升了点击率,标题选择准确率最高达 84%。
Modern media firms require automated and efficient methods to identify content that is most engaging and appealing to users. Leveraging a large-scale dataset from Upworthy (a news publisher), which includes 17,681 headline A/B tests, we first investigate the ability of three pure-LLM approaches to identify the catchiest headline: prompt-based methods, embedding-based methods, and fine-tuned open-source LLMs. Prompt-based approaches perform poorly, while both OpenAI-embedding-based models and the fine-tuned Llama-3-8B achieve marginally higher accuracy than random predictions. In sum, none of the pure-LLM-based methods can predict the best-performing headline with high accuracy. We then introduce the LLM-Assisted Online Learning Algorithm (LOLA), a novel framework that integrates Large Language Models (LLMs) with adaptive experimentation to optimize content delivery. LOLA combines the best pure-LLM approach with the Upper Confidence Bound algorithm to allocate traffic and maximize clicks adaptively. Our numerical experiments on Upworthy data show that LOLA outperforms the standard A/B test method (the current status quo at Upworthy), pure bandit algorithms, and pure-LLM approaches, particularly in scenarios with limited experimental traffic. Our approach is scalable and applicable to content experiments across various settings where firms seek to optimize user engagement, including digital advertising and social media recommendations.
研究动机与目标
- 为了解决标准 A/B 测试在内容实验中效率低下的问题,即所有标题均等分配流量,导致因文章生命周期短而产生高遗憾值。
- 克服在线赌博机算法中的冷启动问题,即在初始探索阶段,次优臂被分配过多流量。
- 评估纯 LLM 方法(提示工程、嵌入表示、微调)在识别更具吸引力标题方面的能力。
- 设计并验证一种混合框架 LOLA,利用 LLM 进行初始排序,赌博机算法实现自适应流量分配,以最大化点击量。
- 展示 LOLA 在多种数字内容场景(包括新闻、社交媒体和广告)中的可扩展性与有效性。
提出的方法
- LOLA 使用 OpenAI 嵌入表示对标题对进行分类,基于预测的点击率(CTR)差异,识别出表现更优标题的准确率约为 82%-84%。
- 将表现最佳的基于 LLM 的分类器与上置信度界(UCB)赌博机算法相结合,根据估计性能和不确定性动态分配流量。
- 算法首先基于 LLM 生成的置信度分数为每个标题赋值,随后使用 UCB 平衡探索与利用,优先选择预期回报高且不确定性高的臂。
- LOLA 在包含 17,681 个 Upworthy 标题 A/B 测试的大规模数据集上进行训练与评估,每个测试均针对同一则文章比较多个标题。
- 随着时间推移,流量分配自适应地向表现更优的标题倾斜,从而最小化遗憾值并提升整体点击产出。
- 该框架设计为可扩展且通用,适用于数字广告、社交媒体和新闻推荐系统中的内容优化。
实验结果
研究问题
- RQ1纯 LLM 方法(提示工程、嵌入表示、微调)在识别两个标题中更具吸引力者方面的表现如何?
- RQ2基于 LLM 的模型能否在标题选择中超越随机猜测?与人类判断相比表现如何?
- RQ3将基于 LLM 的排序与赌博机算法结合,是否能相比标准 A/B 测试和纯赌博机方法减少遗憾值?
- RQ4LOLA 在低流量或高臂内容实验场景中的表现如何?
- RQ5LLM 的集成是否能缓解在线学习算法在内容分发中的冷启动问题?
主要发现
- 基于提示的 LLM 方法在识别更优标题方面的准确率最高仅为 65%,表明该任务上表现欠佳。
- 基于 OpenAI 嵌入的分类模型与微调后的 Llama-3-8b 模型均达到 82%-84% 的准确率,显著优于随机猜测(50% 的期望值)。
- 通过两次调查测量的人类判断准确率分别为 45.22% 和 51.58%,与随机猜测无显著差异,且在不同新闻阅读频率群体间无显著差异。
- 在遗憾值减少与点击率优化方面,LOLA 优于标准 A/B 测试、纯赌博机算法以及纯 LLM 方法,尤其在低流量或高臂场景中表现更优。
- 将 LLM 与赌博机算法结合,显著降低了初期遗憾值,通过 LLM 引导初始流量分配,有效缓解了冷启动问题。
- LOLA 展现出良好的可扩展性与广泛适用性,适用于新闻、社交媒体和数字广告等多种数字内容场景,其中用户参与度是关键指标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。