[논문 리뷰] DataTales: Investigating the use of Large Language Models for Authoring Data-Driven Articles
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 활용하여 데이터 기반 기사의 서사적 콘텐츠를 생성하고, 이를 상호작용 가능한 시각화와 연결하는 프로토타입 시스템인 DataTales를 소개한다. 11명의 데이터 전문가를 대상으로 한 정성적 연구를 통해, 차트 기반 프롬프팅, 주석 안내, 서사 요약과 같은 핵심 기능을 규명하면서도, 환상, 편향, 외부 검증이 필요한 문제점을 제기하며, LLM 통합 데이터 스토리텔링 도구의 설계에 대한 통찰을 제공한다.
Authoring data-driven articles is a complex process requiring authors to not only analyze data for insights but also craft a cohesive narrative that effectively communicates the insights. Text generation capabilities of contemporary large language models (LLMs) present an opportunity to assist the authoring of data-driven articles and expedite the writing process. In this work, we investigate the feasibility and perceived value of leveraging LLMs to support authors of data-driven articles. We designed a prototype system, DataTales, that leverages a LLM to generate textual narratives accompanying a given chart. Using DataTales as a design probe, we conducted a qualitative study with 11 professionals to evaluate the concept, from which we distilled affordances and opportunities to further integrate LLMs as valuable data-driven article authoring assistants.
연구 동기 및 목표
- 대규모 언어 모델(LLMs)을 활용해 데이터 기반 기사 작성에 도움을 주는 것의 가능성과 인식된 가치를 조사하는 것.
- 차트 상호작용이 직접적인 프롬프팅보다 LLM에 서사적 의도를 전달하는 데 더 직관적인 대안이 될 수 있는지 탐색하는 것.
- 데이터 스토리텔링 워크플로우에서 LLM을 협업형 글쓰기 보조 도구로 통합함에 있어 설계적 기능과 과제를 규명하는 것.
- 사용자 주석, 요약, 외부 검증 메커니즘을 통해 LLM이 생성한 서사가 어떻게 향상될 수 있는지 이해하는 것.
- 환상, 확인 편향, 데이터 리터러시 격차와 같은 윤리적 및 신뢰성 문제를 LLM 지원 콘텐츠 생성에서 다루는 것.
제안 방법
- 저자는 GPT-3.5-turbo LLM을 D3.js로 렲한 차트와 React 기반 UI 컴포넌트와 통합한 웹 기반 프로토타입인 DataTales를 개발했다.
- 이 시스템은 사용자가 차트와 선택적 주석을 기반으로 서사 텍스트를 생성할 수 있도록 하며, 텍스트와 시각 요소 간 실시간 상호작용을 가능하게 한다.
- 사용자는 생성된 텍스트를 편집하거나, 스토리를 재생성하거나, 여러 스토리 버전 중에서 선택함으로써 서사 콘텐츠의 반복적 개선이 가능하다.
- 사용자 주석을 통해 초점을 조절하고 맥락을 제공할 수 있으며, 데이터 포인트를 강조하거나 추세선을 그려 중요성을 신호할 수 있다.
- DataTales를 설계 프로브로 활용하여 11명의 데이터 전문가를 대상으로 정성적 연구를 수행하여 사용성, 유용성 및 한계에 대한 피드백을 확보했다.
- 결과는 요약, 외부 데이터 추천, 인용 및 피드백 루프를 통한 오류 완화와 같은 기능을 다루는 13가지 통찰(T1–T13)으로 종합되었다.

실험 결과
연구 질문
- RQ1LLM을 어떻게 효과적으로 활용하여 사용자 서사적 의도와 일치하는 방식으로 데이터 기반 기사 작성에 도움을 줄 수 있는가?
- RQ2전문적 환경에서 데이터 시각화와 연결된 서사를 생성하기 위해 LLM을 사용할 때의 인식된 이점과 과제는 무엇인가?
- RQ3차트 상호작용과 사용자 주석은 LLM이 생성한 스토리의 품질과 관련성에 어떻게 영향을 미치는가?
- RQ4환상, 편향, 오해의 소지가 있는 정보와 같은 위험을 완화하기 위해 필요한 설계 기능은 무엇인가?
- RQ5LLM을 기존의 데이터 리터러시 및 사실 확인 관행과 어떻게 통합하여 책임감 있는 기사 작성 지원을 할 수 있는가?
주요 결과
- 참가자들은 차트 상호작용과 주석을 사용해 서사 생성을 이끄는 방식의 LLM 지원 데이터 스토리텔링 개념을 유용하게 느꼈다.
- 이 시스템은 아이디어 기획과 초안 작성에 도움이 되는 것으로 평가되었으며, 특히 초기 단계의 서사 개발에서 인지적 부담을 줄이는 데 효과적이었다.
- 많은 참가자들이 생성된 스토리가 너무 길어 독해와 검토에 어려움을 겪었으며, 이에 따라 간결한 볼트 포인트 요약 기능이 필요하다는 요구가 제기되었다.
- 매우 많은 환상과 사실 오류가 관찰되었으며, 잘못된 추론과 잘못된 레이블링이 포함되어 있어 외부 검증과 출처 인용이 필수적임을 시사했다.
- 참가자들은 데이터에서 유래된 진술과 LLM이 창작한 내용을 명확히 구분하는 것이 중요하다고 강조했으며, 기원을 신호할 수 있는 시각적 신호(예: 색상 코드)를 제안했다.
- 외부 데이터 세트, 비교 분석, 후속 질문 추천 기능에 대한 관심이 매우 높았으며, 이는 탐색적 분석을 확장하고 더 깊은 통찰 발견을 지원할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.