[论文解读] Palm: Predicting Actions through Language Models @ Ego4D Long-Term Action Anticipation Challenge 2023
Palm 提出了一种基于视觉-语言模型和大语言模型的框架,用于预测第一人称视频中的长期动作,通过图像字幕生成和动作识别来为大语言模型生成自然语言提示。该方法在 Ego4D LTA 挑战赛中取得最先进性能,在测试集上的动作编辑距离达到 0.8856。
We present Palm, a solution to the Long-Term Action Anticipation (LTA) task utilizing vision-language and large language models. Given an input video with annotated action periods, the LTA task aims to predict possible future actions. We hypothesize that an optimal solution should capture the interdependency between past and future actions, and be able to infer future actions based on the structure and dependency encoded in the past actions. Large language models have demonstrated remarkable commonsense-based reasoning ability. Inspired by that, Palm chains an image captioning model and a large language model. It predicts future actions based on frame descriptions and action labels extracted from the input videos. Our method outperforms other participants in the EGO4D LTA challenge and achieves the best performance in terms of action prediction. Our code is available at https://github.com/DanDoge/Palm
研究动机与目标
- 为解决第一人称视频中未来动作不确定且存在多种合理序列的长期动作预测挑战。
- 克服以往模型仅依赖共享特征并独立分类动词/名词的局限性。
- 通过将过去动作和视觉上下文编码为自然语言,利用大语言模型的常识推理能力。
- 通过结构化语言提示建模过去与未来动作之间的依赖关系,以提升预测性能。
- 通过少样本提示与基于 MMR 的样本选择策略,实现鲁棒且多样的动作预测。
提出的方法
- 该方法使用图像字幕模型,从每个过去动作片段的中间帧生成描述性叙述,以 'A person is' 开头。
- 基于 EgoVLP 和 Transformer 的动作识别模型从视频片段中提取 (动词, 名词) 对。
- 将过去动作的描述和标签结合,形成自然语言提示,以句子补全任务形式输入大语言模型。
- 少样本提示模板包含指令、包含过去动作与未来序列的样本示例,以及仅含过去动作的查询。
- 使用基于 MMR 的策略选择样本,通过 MPNet 嵌入和余弦相似度平衡与查询的语义相关性与多样性。
- 通过从大语言模型输出中采样生成多个未来动作序列,并基于与真实序列的最小编辑距离选择最优序列。
实验结果
研究问题
- RQ1大语言模型能否通过利用常识知识和动作序列中的结构依赖关系,提升长期动作预测性能?
- RQ2基于图像字幕和动作标签生成的自然语言提示,在基于大语言模型的动作预测中效果如何?
- RQ3提示设计(包括样本选择和模型规模)对预测准确率和多样性的影响如何?
- RQ4视觉上下文(字幕)和动作标签各自对预测性能的贡献是什么?
- RQ5模型性能在多大程度上受限于过去动作识别模块的准确性?
主要发现
- Palm 在 2023 年 Ego4D 长期动作预测挑战赛中表现最佳,测试集上的动作编辑距离为 0.8856。
- 使用 BLIP2 进行字幕生成优于 vit-gpt2,尤其在名词预测方面,将名词编辑距离降低至 0.6767。
- 引入基于 MMR 的样本选择策略后,性能优于随机选择,动作编辑距离降低至 0.8934。
- 在提示中同时包含叙述和动作标签可获得最佳结果,动作编辑距离为 0.8934,优于单独使用任一模态。
- 更大的语言模型(如 GPT-Neo-1.3B)因具有更大的上下文窗口,性能优于较小的 GPT-2 变体,编辑距离更低。
- 过去动作识别准确率与编辑距离之间存在强烈负相关性,表明模型性能对识别质量高度敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。