[논문 리뷰] Large-Scale Text Analysis Using Generative Language Models: A Case Study in Discovering Public Value Expressions in AI Patents
이 논문은 GPT-4를 사용하여 154,934개의 미국 AI 특허에서 유래한 540만 개 문장에서 공공가치 표현을 식별하기 위한 고품질 레이블과 추론 과정을 생성하는 새로운 프레임워크를 제안한다. 이 방법은 공공가치 콘텐츠를 분류할 때 높은 F1 스코어(3클래스 기준 0.85, 2클래스 기준 0.91)를 달성하여, 구조화된 프롬프트를 활용한 생성 모델이 인간의 노고를 최소화하면서도 확장 가능하고 정확하며 해석 가능한 대규모 텍스트 분석을 가능하게 함을 보여준다.
Labeling data is essential for training text classifiers but is often difficult to accomplish accurately, especially for complex and abstract concepts. Seeking an improved method, this paper employs a novel approach using a generative language model (GPT-4) to produce labels and rationales for large-scale text analysis. We apply this approach to the task of discovering public value expressions in US AI patents. We collect a database comprising 154,934 patent documents using an advanced Boolean query submitted to InnovationQ+. The results are merged with full patent text from the USPTO, resulting in 5.4 million sentences. We design a framework for identifying and labeling public value expressions in these AI patent sentences. A prompt for GPT-4 is developed which includes definitions, guidelines, examples, and rationales for text classification. We evaluate the quality of the labels and rationales produced by GPT-4 using BLEU scores and topic modeling and find that they are accurate, diverse, and faithful. These rationales also serve as a chain-of-thought for the model, a transparent mechanism for human verification, and support for human annotators to overcome cognitive limitations. We conclude that GPT-4 achieved a high-level of recognition of public value theory from our framework, which it also uses to discover unseen public value expressions. We use the labels produced by GPT-4 to train BERT-based classifiers and predict sentences on the entire database, achieving high F1 scores for the 3-class (0.85) and 2-class classification (0.91) tasks. We discuss the implications of our approach for conducting large-scale text analyses with complex and abstract concepts and suggest that, with careful framework design and interactive human oversight, generative language models can offer significant advantages in quality and in reduced time and costs for producing labels and rationales.
연구 동기 및 목표
- 대규모 텍스트 데이터에서 '공공가치'와 같은 복잡하고 추상적인 개념을 레이블링하는 데 도전하는 것.
- 생성 언어 모델을 활용하여 AI 특허 내 공공가치 표현을 식별하는 확장 가능한 방법을 개발하는 것.
- GPT-4가 생성한 레이블과 추론 과정의 품질과 해석 가능성에 대해 인간 검증 및 모델 투명성 확보를 위한 평가를 수행하는 것.
- GPT-4가 생성한 레이블을 기반으로 BERT 기반 분류기를 훈련시어 540만 개의 특허 문장 데이터베이스 전반에서 대규모 분류를 수행하는 것.
- 생성 모델이 미묘한 사회적 개념을 탐지할 때 레이블링 비용과 시간을 줄이면서도 높은 정확도를 유지할 수 있음을 입증하는 것.
제안 방법
- 일致성과 해석 가능성을 보장하기 위해 정의, 분류 지침, 예시 주석, 추론 생성 지침을 포함한 GPT-4 전용 프롬프트를 설계하였다.
- 미국 특허청(USPTO)의 전체 텍스트 데이터와 통합함으로써 154,934개의 미국 AI 특허 데이터셋을 540만 개 문장으로 확장하였다.
- GPT-4는 공공가치 표현에 대해 이진 및 다중 클래스 레이블(3클래스 및 2클래스)을 생성하고, 각 분류 결정에 대한 상세한 추론 과정도 함께 제공하였다.
- 정확도, 다양성, 입력 텍스트에 대한 충실도를 평가하기 위해 BLEU 스코어와 토픽 모델링을 활용하여 레이블 품질을 평가하였다.
- GPT-4가 생성한 레이블을 기반으로 BERT 기반 분류기를 미세조정하여 전체 데이터셋에 대한 추론을 수행하였다.
- 모델 출력이 공공가치 이론과 도메인 의미론에 일치하도록 인간이 개입하는 검증 절차를 도입하였다.
실험 결과
연구 질문
- RQ1GPT-4와 같은 생성 언어 모델은 대규모 특허 텍스트에서 추상적인 공공가치 표현을 신뢰성 있게 식별할 수 있는가?
- RQ2GPT-4가 AI 특허의 공공가치 콘텐츠를 분류할 때 생성하는 추론은 정확하고 다양한가?
- RQ3GPT-4가 생성한 레이블은 대규모 텍스트 분석을 위한 고성능 BERT 기반 분류기 훈련에 어느 정도 기여할 수 있는가?
- RQ4GPT-4가 생성한 추론은 인간 감시와 애너테이션 가이드라인 제공을 위한 투명하고 검증 가능한 사고의 흐름으로 기능할 수 있는가?
- RQ5전통적인 인간 레이블링에 비해, 생성 모델을 사용하여 복잡하고 추상적인 개념을 레이블링할 때의 확장성과 비용 효율성은 어떠한가?
주요 결과
- GPT-4가 생성한 레이블은 3클래스 분류 작업에서 F1 스코어 0.85, 2클래스 작업에서 0.91를 기록하여 공공가치 표현 탐지에 뛰어난 성능을 보였다.
- BLEU 스코어와 토픽 모델링을 통해 확인된 linh의 추론 과정은 높은 충실도와 다양성을 보였으며, 이는 모델의 해석 가능성에 기여하였다.
- 생성된 추론 과정은 투명한 사고의 흐름으로 기능하여 인간 검증을 용이하게 하고, 인간 애너테이터의 인지 부담을 감소시켰다.
- GPT-4가 생성한 레이블을 기반으로 미세조정된 BERT 분류기는 전체 데이터셋에 잘 일반화되어 있어 효율적인 대규모 추론을 가능하게 하였다.
- 이 프레임워크는 레이블링 시간과 비용을 크게 줄였으며, 고품질 출력을 유지하면서도 추상적 개념 탐지에 생성 모델을 활용할 수 있음을 입증하였다.
- 철저한 프롬프트 설계와 인간의 감시가 함께 이루어질 경우, 생성 모델은 복잡한 텍스트 분류 작업에서 수동 레이블링의 확장 가능하고 신뢰할 수 있는 대안이 될 수 있음을 연구는 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.