[论文解读] Investigating the Design Considerations for Integrating Text-to-Image Generative AI within Augmented Reality Environments
本文提出了一种将文本到图像生成式人工智能(AIGC)与增强现实(AR)显示相结合的设计框架,展示了名为GenerativeAIR的原型系统,该系统通过语音输入在三种AR模式——空间式、头戴式和手持式——上生成并投射AI创建的图像与文本。核心贡献是基于焦点小组研究推导出的用户-功能-环境设计思维模型,识别出AIGC+AR系统中隐私、交互性和多用户协作的关键设计考量。
Generative Artificial Intelligence (GenAI) has emerged as a fundamental component of intelligent interactive systems, enabling the automatic generation of multimodal media content. The continuous enhancement in the quality of Artificial Intelligence-Generated Content (AIGC), including but not limited to images and text, is forging new paradigms for its application, particularly within the domain of Augmented Reality (AR). Nevertheless, the application of GenAI within the AR design process remains opaque. This paper aims to articulate a design space encapsulating a series of criteria and a prototypical process to aid practitioners in assessing the aptness of adopting pertinent technologies. The proposed model has been formulated based on a synthesis of design insights garnered from ten experts, obtained through focus group interviews. Leveraging these initial insights, we delineate potential applications of GenAI in AR.
研究动机与目标
- 探索将文本到图像生成式AI与AR显示相结合的设计空间。
- 解决在现实应用中整合AI生成内容(AIGC)与AR时缺乏整体性设计指导的问题。
- 识别影响AIGC+AR系统设计的用户需求、功能需求及环境因素。
- 开发一个原型系统,实现在三种AR显示类型中通过语音驱动的多模态AIGC输出。
- 通过实证焦点小组研究,推导出用户-功能-环境设计框架。
提出的方法
- 构建了一个名为GenerativeAIR的原型系统,整合了Google的语音转文本API、Stable Diffusion以及文本转语音模型,实现语音驱动的内容生成。
- 在三种AR显示类型中部署该系统:三星Freestyle投影仪(空间AR)、HoloLens 2(头戴式显示器)和OnePlus 10 Pro(手持式显示器)。
- 通过用户在不同场景中与原型互动的焦点小组收集反馈。
- 采用定性分析方法,识别用户需求中的重复主题,特别是关于隐私、交互性和多用户协作方面。
- 提出“用户-功能-环境”设计思维模型,以系统化结构化AIGC+AR系统的设计考量。
- 在不同环境(室内/室外)和用户角色(演示者 vs. 观察者)下评估系统性能与用户体验。

实验结果
研究问题
- RQ1如何有效将文本到图像生成式AI集成到多种AR显示模态(空间式、HMD、手持式)中,以支持实时、交互式的内容创作?
- RQ2在AR中部署AI生成内容时,必须考虑哪些设计因素——尤其是用户角色、隐私和环境背景?
- RQ3用户如何感知AI生成内容与AR显示之间在沉浸感、可用性和社交互动方面的相互作用?
- RQ4在使用生成式AI时,单用户与多用户AR体验在功能和体验上存在哪些差异?
- RQ5如何在AIGC+AR系统中实现分层访问与内容共享,以在隐私保护与协作之间取得平衡?
主要发现
- 用户优先考虑隐私和情境意识,尤其是在AI生成内容涉及个人数据(如照片或生活记录)时。
- 手持式显示设备(如智能手机)由于便携性和易用性,具有最广泛的实际应用潜力,适用于实时创意媒体生成。
- 空间AR显示设备增强了公共共享体验,但由于内容在公共视野中可见,引发了隐私担忧。
- 演示者用户(如HMD用户)重视控制权和隐私,而观察者用户则更关注沉浸感和较低的认知负荷。
- “用户-功能-环境”设计模型有效捕捉了AIGC+AR系统设计中的关键权衡,尤其是在基于角色的访问控制和环境适应方面。
- 当前原型仍局限于2D图像生成和离线运行,凸显了未来工作中实现实时3D内容生成与在线集成的迫切需求。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。