[论文解读] OccuQuest: Mitigating Occupational Bias for Inclusive Large Language Models
本论文提出了OccuQuest,一个大规模的指令微调数据集,包含148,772个提示-完成对以及跨26个类别中1,013种职业的31,811段对话,旨在缓解大语言模型中的职业偏见。通过利用GPT-3.5-turbo以分层结构(职业 → 职责 → 主题 → 问题)生成特定职业的查询与回复,作者将LLaMA微调为OccuLLaMA,其在真实职业查询任务中对WizardLM的胜率高达86.4%,且在GSM8K上的表现优于其他7B参数模型4个百分点以上。
The emergence of large language models (LLMs) has revolutionized natural language processing tasks. However, existing instruction-tuning datasets suffer from occupational bias: the majority of data relates to only a few occupations, which hampers the instruction-tuned LLMs to generate helpful responses to professional queries from practitioners in specific fields. To mitigate this issue and promote occupation-inclusive LLMs, we create an instruction-tuning dataset named \emph{OccuQuest}, which contains 110,000+ prompt-completion pairs and 30,000+ dialogues covering over 1,000 occupations in 26 occupational categories. We systematically request ChatGPT, organizing queries hierarchically based on Occupation, Responsibility, Topic, and Question, to ensure a comprehensive coverage of occupational specialty inquiries. By comparing with three commonly used datasets (Dolly, ShareGPT, and WizardLM), we observe that OccuQuest exhibits a more balanced distribution across occupations. Furthermore, we assemble three test sets for comprehensive evaluation, an occu-test set covering 25 occupational categories, an estate set focusing on real estate, and an occu-quora set containing real-world questions from Quora. We then fine-tune LLaMA on OccuQuest to obtain OccuLLaMA, which significantly outperforms state-of-the-art LLaMA variants (Vicuna, Tulu, and WizardLM) on professional questions in GPT-4 and human evaluations. Notably, on the occu-quora set, OccuLLaMA reaches a high win rate of 86.4\% against WizardLM.
研究动机与目标
- 为解决现有指令微调数据集中职业偏见问题,这些数据集主要偏向人工智能/科技类职业,而对非技术领域从业者覆盖不足。
- 构建一个全面且职业包容的指令微调数据集,涵盖26个类别中超过1,000种职业。
- 开发并评估一个微调后的LLaMA模型(OccuLLaMA),使其在专业、职业特定查询上的表现显著优于现有SOTA模型。
- 证明将OccuQuest与其他数据集结合,可进一步提升大语言模型在通用和专业基准测试中的整体性能。
提出的方法
- 作者从Workable的职位描述资源中收集了26个职业类别下的1,013个职位名称及其职责。
- 利用GPT-3.5-turbo通过分层提示策略生成特定职业的查询与回复:职业 → 职责 → 主题 → 问题。
- 数据集包含114,090个提示-完成对和31,682段多轮对话,总计145,772个样本。
- 构建了三个评估测试集:occu-test(25个类别)、estate(房地产)、occu-quora(真实世界Quora问题)。
- 在OccuQuest上微调LLaMA以构建OccuLLaMA,并使用OccuQuest与Tulu的混合数据训练ProLLaMA。
- 通过GPT-4偏好评分和人类评估,在专业问答任务上评估模型性能。

实验结果
研究问题
- RQ1与现有数据集相比,大规模、职业包容的指令微调数据集是否能显著减少大语言模型中的职业偏见?
- RQ2在OccuQuest上微调是否能显著提升大语言模型在专业、职业特定查询上的表现,相比SOTA指令微调模型?
- RQ3将OccuQuest与其他指令微调数据集结合,能在多大程度上提升大语言模型在通用和专业基准测试中的整体性能?
主要发现
- 与Dolly、ShareGPT和WizardLM相比,OccuQuest在职业类别的分布更加均衡,各类别占比为2–6%,而后者在‘IT与开发’类别中占比超过15%。
- OccuLLaMA在occu-quora测试集上对WizardLM的胜率达到86.4%,表明其在真实世界专业查询任务中表现更优。
- 7B和13B参数的ProLLaMA模型在MMLU和GSM8K上表现最佳,其中7B参数的ProLLaMA在GSM8K上的表现优于其他7B参数模型4个百分点以上。
- 仅在OccuQuest上微调即可提升专业查询任务的性能,而将其与Tulu结合使用可进一步增强在MMLU、GSM8K、BBH和HumanEval等通用基准测试中的表现。
- OccuQuest的平均回复长度为351.0个token,对话平均为6.4轮,表明其包含丰富且多轮的专业互动。
- 该数据集已公开发布于Hugging Face,包含OccuQuest、OccuLLaMA-7B和ProLLaMA-7B,支持更广泛的研究与模型开发。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。