ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling

ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling 文章主要内容总结本文介绍了一个大规模中文医疗数据集ChiMed 2.0,旨在推动中文医疗领域大语言模型(LLM)的研究与应用。该数据集扩展了此前的ChiMed工作,整合了来自中文医疗在线平台的真实数据和LLM生成的数据,涵盖传统中医经典文献和现代通用医疗数据,总规模达2.044亿汉字。具体而言,ChiMed 2.0包含三部分核心数据:16.48万篇预训练文档、35.16万对有监督微调(SFT)问答对、4.17万条人类反馈强化学习(RLHF)偏好数据元组。为保证数据质量,研究设计了多阶段处理流程,包括去重、噪声过滤、敏感内容筛选、古文转现代文翻译、自动生成问答对和偏好数据等。实验部分,研究团队在不同规模的通用LLM(如Qwen-3 1.7B和14B)上进行了预训练、SFT和RLHF,并在医疗基准数据集CMMLU和CEval上评估性能。结果显示,无论模型规模大小,基于ChiMed 2.0训练的模型在医疗相关任务上均表现出显著性能提升,验证了该数据集的有效性和适用性。创新点全面覆盖多阶段训练需求:ChiMed 2.0首次整合传统中医经典与现代临床内容,同时支持LLM的预训练、有监督微调(SFT)和人类反馈强化学习(RLHF),填补了现有中文医疗数据集在训练阶段覆盖上的空白。多阶段高质量数据处理流程:设计了包含去重、噪声过滤、敏感内容筛查、古文转现代文翻译、自动生成问答对和偏好数据的处理 pipeline,确保数据质量与多样性,尤其解决了中医古文可读性低的问题。验证了跨规模模型的有
返回列表