Skip to main content
QUICK REVIEW

[论文解读] ChatHome: Development and Evaluation of a Domain-Specific Language Model for Home Renovation

Wen Cheng, Xianghui Sun|arXiv (Cornell University)|Jul 28, 2023
Topic Modeling被引用 6
一句话总结

本文提出了ChatHome,一种通过在专业文章、标准和网络内容的精选数据集上进行领域自适应预训练和指令微调而开发的家装领域专用语言模型。该模型在新推出的领域基准EvalHome上取得了SOTA性能,得分69.03,超越了基础模型和指令微调变体,表明在领域自适应过程中整合下游指令数据能显著提升领域特定准确性,同时不损害通用能力。

ABSTRACT

This paper presents the development and evaluation of ChatHome, a domain-specific language model (DSLM) designed for the intricate field of home renovation. Considering the proven competencies of large language models (LLMs) like GPT-4 and the escalating fascination with home renovation, this study endeavors to reconcile these aspects by generating a dedicated model that can yield high-fidelity, precise outputs relevant to the home renovation arena. ChatHome's novelty rests on its methodology, fusing domain-adaptive pretraining and instruction-tuning over an extensive dataset. This dataset includes professional articles, standard documents, and web content pertinent to home renovation. This dual-pronged strategy is designed to ensure that our model can assimilate comprehensive domain knowledge and effectively address user inquiries. Via thorough experimentation on diverse datasets, both universal and domain-specific, including the freshly introduced "EvalHome" domain dataset, we substantiate that ChatHome not only amplifies domain-specific functionalities but also preserves its versatility.

研究动机与目标

  • 为解决当前家装领域缺乏专用语言模型的问题,因为通用大模型(如ChatGPT)常出现幻觉或缺乏精确性。
  • 开发一种高保真、具备领域意识的语言模型,以满足家装领域复杂多学科的需求,涵盖设计、施工和空间规划。
  • 评估在领域自适应预训练后进行指令微调是否能同时提升领域特定性能和通用能力。
  • 引入一个新的基准数据集EvalHome,以实现对家装领域专用大语言模型的严格评估。

提出的方法

  • 使用家装内容的精选语料库(包括国家标准、书籍和网络文章)对Baichuan-13B基础模型进行领域自适应预训练(DAPT)微调。
  • 从WuDaoCorpora构建通用语料库,以在预训练期间保持通用知识的平衡。
  • 通过从家装提示中提取的问答对进行指令微调,使模型与用户指令任务对齐。
  • 在DAPT阶段通过结合领域预训练数据和指令数据,提出一种多任务指令预训练(MIP)策略,提升性能且无需额外通用数据。
  • 在通用基准(C-Eval、CMMLU)和新推出的领域专用EvalHome数据集上评估模型性能,以衡量领域专长与泛化能力之间的权衡。
  • 通过数据比例分析(1:0至1:10)确定领域与通用数据的最佳平衡,识别出1:5为性能最佳的折中方案。

实验结果

研究问题

  • RQ1与通用大模型相比,是否可通过领域自适应预训练后接指令微调,显著提升大语言模型在家装任务上的表现?
  • RQ2为在保持通用能力的同时最大化领域特定准确率,领域特定语料与通用语料的最佳数据比例是多少?
  • RQ3在领域自适应预训练阶段整合下游指令数据(MIP)是否优于仅在DAPT后进行指令微调?
  • RQ4与基础模型和指令微调变体相比,像ChatHome这样的领域专用模型在家装专用新基准EvalHome上的表现如何?
  • RQ5在经过大量领域微调后,模型在多大程度上仍保留通用知识,这对整体实用性有何影响?

主要发现

  • MIP模型(在领域自适应预训练阶段整合指令数据)在EvalHome上取得了最高的得分69.03,优于所有其他变体,包括指令微调后的Baichuan-13B-Chat。
  • DAPT阶段采用1:5(领域数据与通用数据)的数据比例取得了最佳平衡,与基础模型相比,C-Eval和CMMLU上的通用能力下降分别仅为2.57和3.08分。
  • DAPT后进行指令微调可提升领域性能,但MIP方法——即同时训练领域和指令数据——产生了更优结果,表明两个阶段之间存在协同效应。
  • MIP模型不仅在领域特定任务上得分最高,且在通用基准上得分也更高(C-Eval: 49.07,CMMLU: 49.12),表明其泛化能力未出现显著退化。
  • 该模型在家装推理和事实准确性方面在EvalHome上表现出显著提升,表明其能有效从高质量、经筛选的家装数据中获取知识。
  • 尽管性能有所提升,模型仍存在幻觉问题,凸显未来需整合检索增强生成或强化学习技术以进一步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。