Skip to main content
QUICK REVIEW

[논문 리뷰] Harnessing the Power of LLMs: Evaluating Human-AI Text Co-Creation through the Lens of News Headline Generation

Zijian Ding, Alison Smith|arXiv (Cornell University)|2023. 10. 16.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 40명의 참가자를 대상으로 한 통제된 실험을 통해 가이던스, 선택, 후편집의 세 가지 상호작용 유형을 사용하여 뉴스 헤드라인 생성에서 인간과 AI의 공동 창작을 평가한다. 연구 결과, 가이던스와 선택의 조합이 가장 높은 품질의 헤드라인을 낮은 노력으로 생성하며, AI 보조가 사용자의 통제감이나 신뢰감을 떨어뜨리지 않는다는 것을 확인했다.

ABSTRACT

To explore how humans can best leverage LLMs for writing and how interacting with these models affects feelings of ownership and trust in the writing process, we compared common human-AI interaction types (e.g., guiding system, selecting from system outputs, post-editing outputs) in the context of LLM-assisted news headline generation. While LLMs alone can generate satisfactory news headlines, on average, human control is needed to fix undesirable model outputs. Of the interaction methods, guiding and selecting model output added the most benefit with the lowest cost (in time and effort). Further, AI assistance did not harm participants' perception of control compared to freeform editing.

연구 동기 및 목표

  • 다양한 인간-AI 상호작용 방식이 뉴스 헤드라인 생성의 품질, 노력, 그리고 소유감 인식에 미치는 영향을 조사하기 위해.
  • AI 보조가 사용자의 글쓰기 과정에서의 통제감이나 신뢰감을 약화시키는지 평가하기 위해.
  • 텍스트 공동 창작 작업에서 인간의 통제와 AI의 효율성 사이의 최적 균형을 규명하기 위해.
  • 실증적 사용자 상호작용 데이터를 바탕으로 LLM 기반 글쓰기 도구의 설계 지침을 제공하기 위해.
  • 향후 뉴스 맥락에서 LLM의 평가 및 RLHF 미세조정을 위한 840개의 인간 평가 헤드라인 데이터셋을 공개하기 위해.

제안 방법

  • 편집 경험이 있는 참가자 40명을 대상으로 한 통제된 간접 설계 실험을 수행하였다.
  • 가이던스, 선택, 후편집의 세 가지 상호작용 유형을 지원하는 프로토타입 LLM 기반 헤드라인 생성 시스템을 사용하였다.
  • 다섯 가지 헤드라인 생성 조건을 비교하였다: 수동 작성, AI 전용 생성, 그리고 세 가지 보조 변형(가이던스, 가이던스+선택, 가이던스+선택+후편집).
  • 헤드라인 품질 평가에 맛, 매력도, 명확도, 진실성(TACT) 프레임워크를 사용하여 20명의 전문 평가자들이 평가하였다.
  • 심리적 및 사용성 요소를 평가하기 위해 통제감, 신뢰도, 노력도에 대한 주관적 피드백을 수집하였다.
  • 정량적 및 정성적 데이터를 분석하여 각 조건 간 성능, 효율성, 사용자 경험을 비교하였다.
Figure 1: Human-AI interactions for text generation can fall within a range of no human control effort (AI-only) to full human control effort (manual methods) Ding and Chan ( 2023 ) . Selecting from model outputs ( Selection ) alone provides less control (but also is easier) than when adding additio
Figure 1: Human-AI interactions for text generation can fall within a range of no human control effort (AI-only) to full human control effort (manual methods) Ding and Chan ( 2023 ) . Selecting from model outputs ( Selection ) alone provides less control (but also is easier) than when adding additio

실험 결과

연구 질문

  • RQ1TACT 기준에 따라 가장 높은 품질의 뉴스 헤드라인을 생성하는 인간-AI 상호작용 방식은 무엇인가?
  • RQ2헤드라인 품질을 유지하면서도 사용자가 느끼는 노력과 시간 비용을 최소화하는 방식은 무엇인가?
  • RQ3AI 보조는 최종 헤드라인에 대한 사용자의 통제감과 신뢰도에 어떤 영향을 미치는가?
  • RQ4가이던스, 선택, 후편집 등의 다양한 상호작용 유형이 헤드라인 품질과 사용자 경험에 미치는 비교적 영향은 무엇인가?
  • RQ5가이던스와 선택의 조합이 공동 창작 작업에서 단독 방법이나 수동 작성보다 뛰어난 성능을 보일 수 있는가?

주요 결과

  • LLM만으로 생성한 헤드라인은 인간이 작성한 것과 평균 품질이 유사했지만, 여전히 오류 수정을 위해 인간의 보완이 필요했다.
  • 가이던스와 선택의 조합이 가장 높은 품질의 헤드라인을 낮은 시간과 노력으로 생성하였다.
  • 후편집과 수동 작성은 가이던스+선택보다 훨씬 더 많은 노력이 필요했으며, 이에 비해 헤드라인 품질 향상은 없었다.
  • 참가자들은 AI 전용 및 수동 편집 조건을 포함하여 모든 조건에서 유사한 수준의 통제감과 신뢰도를 느꼈다.
  • 가이던스 + 선택이 품질, 효율성, 사용자 경험의 균형을 고려할 때 최적의 상호작용 패턴으로 나타났다.
  • 이 연구는 향후 뉴스 생성 맥락에서 LLM의 평가 및 RLHF 미세조정을 위한 840개의 인간 평가 헤드라인 데이터셋을 공개하였다.
Figure 2: Interface for human-AI news headline co-creation for guidance + selection + post-editing condition: (A) news reading panel, (B) perspectives (keywords) selection panel (multiple keywords can be selected), (C) headline selection panel with post-editing capability, and (D) difficulty rating
Figure 2: Interface for human-AI news headline co-creation for guidance + selection + post-editing condition: (A) news reading panel, (B) perspectives (keywords) selection panel (multiple keywords can be selected), (C) headline selection panel with post-editing capability, and (D) difficulty rating

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.