[논문 리뷰] Design Space and Implementation of RAG-Based Avatars for Virtual Archaeology
본 논문은 문화유산용 VR에서 RAG 구동 아바타를 위한 설계 공간을 정의하고, Maxentius mausoleum을 중심으로 VR 프로토타입을 구축하며, VR 맥락에서 RAG 구성과 사용자 작업부하를 평가한다.
Immersive technologies, such as virtual and augmented reality, are transforming digital heritage by enabling users to explore and interact with culturally significant sites. It is now possible to view and augment digital twins, or digitally reconstructed versions of them, and to enable access to previously unreachable locations for a broader audience. Here, we investigate retrieval-augmented generation (RAG)-based avatars as an interface for accessing further information about digital cultural heritage objects while immersed in dedicated virtual environments. We present a requirement design space that spans the application realm, avatar personality, and I/O modalities. We instantiate it with a RAG system coupled to a conversational avatar in a virtual reality (VR) environment, using the Maxentius mausoleum from the 4th century AD as a case study, through which users gain access to curated on-demand information of the digitised heritage object. Our workflow utilises scholarly texts and enriches them with metadata. We evaluate various RAG configurations in terms of answer quality on a small expert-crafted question-answer set, as well as the perceived workload of users of a VR setup using such a RAG avatar. We demonstrate evidence that users perceive the overall workload for interacting with such an avatar as below average and that such avatars help to gain topical engagement. Overall, our work demonstrates how to utilise RAG-driven VR avatars for archaeological purposes and provides evidence that they can offer a pathway for immersive, AI-enhanced digital heritage applications.
연구 동기 및 목표
- 문화유산 활용을 위한 VR에서 AI 구동 아바타를 위한 요구사항 설계 공간을 제안한다.
- Maxentius mausoleum을 사례 연구로 활용하여 VR 환경에서 RAG 기반 아바타 프로토타입을 구현한다.
- VR 상호작용에서 다양한 RAG 구성들이 답변 품질과 사용자 작업부하에 미치는 영향을 평가한다.
- 몰입형 AI 강화 디지털 유산 애플리케이션의 가능성을 입증하고 실무자를 위한 설계 고려사항을 개요한다.
제안 방법
- 시스템 요구사항을 안내하기 위해 세 가지 블록으로 구성된 개념 설계(애플리케이션 영역, 아바타 성격, 아바타 I/O)를 개발한다.
- 로컬 데이터 저장, 임베딩 기반 검색, 대화를 위한 TTS를 갖춘 논리적 VR–RAG 아키텍처 설계.
- Qdrant 벡터 저장소와 CIDOC-CRM에 기반한 메타데이터 접근법을 사용하여 로컬 FlowiseAI RAG 스택에 연결된 물리적 Unity 기반 VR 프로토타입을 구현한다.
- Maxentius mausoleum에 초점을 맞춘 문헌 기반 지식 베이스를 선별하고 저자, 제목, 게시 유형, 관련성으로 메타데이터를 보강한다.
- 전문가가 생성한 QA 쌍과 LLM-as-judge 지표를 사용하여 여러 RAG 구성(일곱 가지 설정)을 평가하고, VR 사용자에 대해 NASA-TLX 작업부하 평가를 실시한다.
실험 결과
연구 질문
- RQ1VR CH 맥락에서 AI 구동 아바타를 위한 설계 공간을 어떻게 구성하여 애플리케이션, 성격, I/O 고려사항을 포괄할 수 있는가?
- RQ2문화유산 분야에서 온프레미스 VR 배치를 위한 답변 품질과 계산적 실용성 사이의 최적 균형을 제공하는 RAG 구성이 무엇인가?
- RQ3VR에서 RAG 기반 아바타와의 상호작용이 사용자 작업부하와 지각된 몰입도에 어떤 영향을 미치는가?
- RQ4RAG-RV 배치에서 도메인 특화 추론을 가장 잘 지원하는 실용적 워크플로와 메타데이터 전략은 무엇인가?
- RQ5특정 고고학적 객체(Maxentius mausoleum)에 대한 전문가 수준의 정보를 효과적으로 전달하면서 창의성과 정확성을 통제된 상태로 유지할 수 있는가?
주요 결과
- RAG 구동 VR 아바타는 VR 문화유산 맥락에서 온디맨드(수요에 맞춘) 전문가 수준의 정보를 제공할 수 있다.
- 다른 RAG 구성이 답변 품질에 영향을 미치며, 도메인 인식 메타데이터와 지식 그래프가 검색 가이던스를 향상시킨다.
- 사용자들은 VR에서 RAG 아바타와 상호작용할 때 평균 이하의 작업부하를 보고하며, 몰입형 유산 탐색에 대한 우수한 사용성을 시사한다.
- 선정된 문헌으로 구성된 순수한 온프레미스 저온 RAG 설정은 학술적 사용에 적합한 책임 있는, 비창의성 중심의 응답을 지원한다.
- Maxentius mausoleum 사례 연구는 OCR'd 문헌에서 CIDOC-CRM에 기반한 지식 그래프를 구동하는 GraphRAG 시스템으로의 실행 가능한 워크플로를 보여준다.
- 이 연구는 AI 구동 아바타가 몰입형의 AI 강화 디지털 유산 애플리케이션을 촉진할 수 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.