[논문 리뷰] OccuQuest: Mitigating Occupational Bias for Inclusive Large Language Models
이 논문은 1,013개 직업 분야의 26개 카테고리에 걸쳐 148,772개의 프롬프트-완성 쌍과 31,811개의 대화를 포함하는 대규모 지시튜닝 데이터셋 OccuQuest를 소개한다. 이는 대규모 언어모델(LLM)의 직업적 편향을 완화하기 위해 설계되었다. 저자들은 GPT-3.5-turbo를 활용하여 계층적 프롬프팅 구조(직업 → 책임 → 주제 → 질문)를 통해 직업별로 특화된 질문과 응답을 생성하고, 이를 바탕으로 LLaMA를 OccuLLaMA로 피니테인딩하였다. 이 모델은 실제 직업적 질문에 대해 WizardLM 대비 86.4%의 승리 비율을 기록했으며, 다른 7B 버전 대비 GSM8K에서 4점 이상 향상된 성능을 보였다.
The emergence of large language models (LLMs) has revolutionized natural language processing tasks. However, existing instruction-tuning datasets suffer from occupational bias: the majority of data relates to only a few occupations, which hampers the instruction-tuned LLMs to generate helpful responses to professional queries from practitioners in specific fields. To mitigate this issue and promote occupation-inclusive LLMs, we create an instruction-tuning dataset named \emph{OccuQuest}, which contains 110,000+ prompt-completion pairs and 30,000+ dialogues covering over 1,000 occupations in 26 occupational categories. We systematically request ChatGPT, organizing queries hierarchically based on Occupation, Responsibility, Topic, and Question, to ensure a comprehensive coverage of occupational specialty inquiries. By comparing with three commonly used datasets (Dolly, ShareGPT, and WizardLM), we observe that OccuQuest exhibits a more balanced distribution across occupations. Furthermore, we assemble three test sets for comprehensive evaluation, an occu-test set covering 25 occupational categories, an estate set focusing on real estate, and an occu-quora set containing real-world questions from Quora. We then fine-tune LLaMA on OccuQuest to obtain OccuLLaMA, which significantly outperforms state-of-the-art LLaMA variants (Vicuna, Tulu, and WizardLM) on professional questions in GPT-4 and human evaluations. Notably, on the occu-quora set, OccuLLaMA reaches a high win rate of 86.4\% against WizardLM.
연구 동기 및 목표
- 지시튜닝 데이터셋에서 지배적으로 AI/기술 분야의 직업에 치우쳐 있고 비기술 분야의 전문가들이 부족하게 반영된 점을 해결하기 위해 직업적 편향을 완화하는 것.
- 26개 카테고리에 걸쳐 1,000개 이상의 직업을 포함하는 포괄적이고 직업에 대한 포용성을 고려한 지시튜닝 데이터셋을 구축하는 것.
- 기존 최신 기술 모델보다 전문적이고 직업 특화된 질문에 대해 뛰어난 성능을 보이는 피니테인딩된 LLaMA 모델(OccuLLaMA)을 개발하고 평가하는 것.
- OccuQuest를 다른 데이터셋과 조합하여 일반 및 전문 기준에서 LLM 성능을 추가로 향상시킬 수 있는지 입증하는 것.
제안 방법
- 저자들은 Workable의 직무 기술 자료에서 26개 직업 카테고리에 걸쳐 1,013개의 직무 명칭과 책임을 수집하였다.
- GPT-3.5-turbo를 사용하여 계층적 프롬프팅 전략(직업 → 책임 → 주제 → 질문)을 통해 직업별로 특화된 질문과 응답을 생성하였다.
- 데이터셋은 114,090개의 프롬프트-완성 쌍과 31,682개의 다중턴 대화로 구성되어 총 145,772개의 인스턴스를 포함한다.
- 세 가지 평가 테스트 세트를 구성하였다: occu-test(25개 카테고리), estate(부동산), occu-quora(실제 Quora 질문).
- LLaMA는 OccuQuest로 피니테인딩되어 OccuLLaMA로, OccuQuest와 Tulu의 혼합 데이터로 ProLLaMA를 훈련시켰다.
- 전문 질문-답변 작업에서 GPT-4 선호도 평가 및 인간 평가를 통해 성능을 평가하였다.

실험 결과
연구 질문
- RQ1기존 데이터셋과 비교해 대규모이고 직업에 포용적인 지시튜닝 데이터셋은 LLM의 직업적 편향을 줄이는 데 효과적인가?
- RQ2OccuQuest로 피니테인딩하면 기존 최신 기술 지시튜닝 모델 대비 전문적이고 직업 특화된 질문에 대해 LLM 성능이 어떻게 향상되는가?
- RQ3OccuQuest를 다른 지시튜닝 데이터셋과 조합하면 일반 및 전문 기준에서 전체 LLM 성능을 얼마나 향상시킬 수 있는가?
주요 결과
- Dolly, ShareGPT, WizardLM와 비교해 OccuQuest는 직업 카테고리 간에 훨씬 더 균형 잡힌 분포를 보이며, 각 카테고리당 2–6%의 데이터를 포함하는 반면, 후자들은 'IT 및 개발' 분야에서 15% 이상을 차지한다.
- Occu-quora 테스트 세트에서 OccuLLaMA는 WizardLM 대비 86.4%의 승리 비율을 기록하여 실제 전문 질문에서 뛰어난 성능을 입증하였다.
- 7B 및 13B ProLLaMA 모델은 MMLU와 GSM8K에서 최고 성능을 기록했으며, 다른 7B 버전 대비 7B ProLLaMA 모델은 GSM8K에서 4점 이상 향상된 성능을 보였다.
- OccuQuest로만 피니테인딩하면 전문 질문 성능이 향상되며, Tulu와 조합하면 MMLU, GSM8K, BBH, HumanEval와 같은 일반 기준에서도 성능 향상이 더욱 뚜렷하게 나타났다.
- OccuQuest의 평균 응답 길이는 351.0 토큰이며, 대화 평균은 6.4턴으로 전문적 상호작용이 풍부하게 구성되어 있음을 시사한다.
- 이 데이터셋은 Hugging Face에 공개되어 있으며, OccuQuest, OccuLLaMA-7B, ProLLaMA-7B를 포함하여 더 넓은 연구 및 모델 개발을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.