[논문 리뷰] Standardizing the Measurement of Text Diversity: A Tool and a Comparative Analysis of Scores
이 논문은 압축 비율, 장거리 n-gram의 자기 반복성, Self-BLEU, BERTScore를 사용하여 LLM 출력의 텍스트 다양성 측정을 위한 표준화되고 계산적으로 효율적인 프레임워크를 제안한다. 압축 비율과 자기 반복성은 반복성을 잘 측정하는 강력한 지표이며, 상관관계가 낮아, 다양한 데이터셋과 모델 간 일관된 다양성 평가를 가능하게 하는 오픈소스 파이썬 패키지를 함께 제공한다.
The diversity across outputs generated by LLMs shapes perception of their quality and utility. High lexical diversity is often desirable, but there is no standard method to measure this property. Templated answer structures and ``canned'' responses across different documents are readily noticeable, but difficult to visualize across large corpora. This work aims to standardize measurement of text diversity. Specifically, we empirically investigate the convergent validity of existing scores across English texts, and we release diversity, an open-source Python package for measuring and extracting repetition in text. We also build a platform based on diversity for users to interactively explore repetition in text. We find that fast compression algorithms capture information similar to what is measured by slow-to-compute $n$-gram overlap homogeneity scores. Further, a combination of measures -- compression ratios, self-repetition of long $n$-grams, and Self-BLEU and BERTScore -- are sufficient to report, as they have low mutual correlation with each other.
연구 동기 및 목표
- LLM 생성 텍스트에서 반복성과 다양성을 측정하기 위한 표준화되고 신뢰할 수 있는 지표의 부족을 해결하기 위해.
- 반복성의 핵심 요소를 포괄하는 통계적으로 독립적이고 계산적으로 효율적인 다양성 점수의 최소 집합을 식별하기 위해.
- 요약, 에세이, 지시 fine-tuning 데이터셋 등 다양한 텍스트 유형에서 이러한 점수의 성능을 평가하기 위해.
- NLP 연구 분야에서 다양성 평가의 일관성과 재현 가능성을 촉진하기 위해 오픈소스 파이썬 패키지를 공개하기 위해.
제안 방법
- CNN/DM 요약 및 지시 테이닝 데이터를 포함한 여러 LLM 생성 영문 텍스트 데이터셋에서 12개의 다양성 점수를 경험적으로 비교한다.
- 정보 내용과 반복성을 신속하게 대체할 수 있는 압축 비율(예: gzip를 통한)을 사용하여 원시 텍스트와 품사(POS) 시퀀스의 압축 비율을 측정한다.
- 장거리 n-gram(≥5)의 자기 반복성을 계산하여 다양한 출력 간 정확하거나 근사적인 반복을 탐지한다.
- n-gram 겹침과 의미적 겹침을 각각 평가하기 위해 Self-BLEU와 BERTScore를 적용하고, 다른 지표와의 상관관계를 평가한다.
- 텍스트 길이의 영향을 제어하기 위해 길이를 자르거나 다운샘플링하고, 모든 다양성 점수와 함께 길이를 보고하여 해석 가능성 확보.
- 연구자들이 이러한 점수를 일관되게 계산하고 비교할 수 있도록 `diversity` 파이썬 패키지(PyPI)를 공개한다.

실험 결과
연구 질문
- RQ1LLM 생성 텍스트에서 반복성을 가장 효과적으로 캡처하는 다양성 점수는 무엇이며, 서로 간의 상관관계는 어떻게 되는가?
- RQ2압축 비율과 같이 계산적으로 효율적인 점수는 n-gram 균일성이나 BERTScore와 같이 더 느린 복잡한 지표를 신뢰성 있게 대체할 수 있는가?
- RQ3요약, 에세이, 지시 테이닝 데이터셋 등 다양한 유형의 텍스트에서 다양성 점수는 어떻게 달라지는가?
- RQ4텍스트 길이가 다양성 측정에 얼마나 큰 혼란을 줄 수 있으며, 비교 연구에서 이를 어떻게 완화할 수 있는가?
- RQ5어떤 점수 조합이 텍스트 다양성의 가장 정보적이고 독립적인 특성화를 제공하는가?
주요 결과
- 원시 텍스트와 POS 시퀀스의 압축 비율은 더 복잡한 다양성 지표와 강하게 상관되며 계산적으로 효율적이므로 표준화에 매우 적합한 후보이다.
- 장거리 n-gram(≥5)의 자기 반복성은 해석이 용이하고 중간 정도로 상관관계가 낮아, 출력 간 정확한 반복을 효과적으로 포착한다.
- Self-BLEU는 압축 비율과 자기 반복성과 약한 상관관계를 보이며, 계산 비용이 크지만 보완적인 지표로 유용하다.
- BERTScore는 인간이 생성한 텍스트와 모델이 생성한 텍스트 간에 변동이 거의 없고, 길이 조정된 다양성 지표와도 낮은 상관관계를 보이며, 다양성 평가에 한계가 있음을 시사한다.
- 텍스트 길이는 주요 혼란 요인이다. 모든 다양성 지표가 텍스트 길이와 강하게 상관되므로, 유효한 비교를 위해서는 길이 보고 또는 정규화가 필수적이다.
- Open Assistant 지시 데이터셋은 Dolly, Alpaca, Super-NaturalInstructions보다 훨씬 높은 다양성을 보이며, Unnatural Instructions는 극도로 반복적인 경향을 보여 데이터 품질 문제의 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.