[论文解读] Making Videos Accessible for Blind and Low Vision Users Using a Multimodal Agent Video Player
论文提出一种多模态代理视频播放器(MAVP),通过多模态大语言模型(MLLM)和对话式架构,为盲/弱视(BLV)用户提供交互式、自主的视频观看体验,并通过用户研究进行验证。
Video content remains largely inaccessible to blind and low-vision (BLV) users. To address this, we introduce a prototype that leverages a multimodal agent - powered by a novel conversational architecture using a multimodal large language model (MLLM) - to provide BLV users with an interactive, accessible video experience. This Multimodal Agent Video Player (MAVP) demonstrates that an interactive accessibility mode can be added to a video through multilayered prompt orchestration. We describe a user-centered design process involving 18 sessions with BLV users that showed that BLV users do not just want accessibility features, but desire independence and personal agency over the viewing experience. We conducted a qualitative study with an additional 8 BLV participants; in this, we saw that the MAVP's conversational dialogue offers BLV users a sense of personal agency, fostering collaboration and trust. Even in the case of hallucinations, it is meta-conversational dialogues about AI's limitations that can repair trust.
研究动机与目标
- 通过多模态代理技术证明可以为视频内容添加一个互动无障碍模式。
- 研究多模态大语言模型(MLLM)和对话式架构如何支持 BLV 用户控制和理解视频内容。
- 通过对 BLV 参与者的定性研究,评估 MAVP 系统中用户感知的独立性、主动性和信任。
- 探究关于 AI 限制的元对话如何在 AI 出错时修复信任。
提出的方法
- 开发一个原型 MAVP,将多模态大语言模型整合到视频观看过程中的对话交互中。
- 使用多层次提示编排,在视频播放器中创建一个互动的无障碍模式。
- 进行以用户为中心的设计过程,包含 18 次 BLV 会话,以获取关于独立性和主动性的定性见解。
- 再进行一次包含 8 名 BLV 参与者的定性研究,评估感知的主动性、协作和信任。
- 分析关于 AI 限制的对话如何影响信任和用户满意度。
实验结果
研究问题
- RQ1多模态代理视频播放器是否能够为 BLV 用户提供对观看体验的独立感和个人主动性?
- RQ2MAVP 的对话式对话是否促进 BLV 用户与 AI 助手之间的协作与信任?
- RQ3关于 AI 限制的元对话讨论在交互式视频访问过程中如何影响用户信任?
- RQ4来自用户会话的哪些设计洞见可用于改进视频回放的无障碍性和自主性?
主要发现
- BLV 用户渴望独立性和个人主动性,而不仅仅是无障碍功能。
- MAVP 的对话式对话促进了 BLV 用户与 AI 的协作与信任感。
- 关于 AI 限制的元对话讨论即使在系统产生幻觉时也有助于修复信任。
- 以 BLV 参与者为中心的设计过程为互动无障碍的视频播放器提供了可操作的洞见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。