
医院每天都在产生大量数据。病历、检验、检查、影像、手术记录、用药信息、随访结果……这些数据过去主要服务于诊疗、管理和科研。随着数据要素相关制度逐步完善它们的价值边界正在发生变化。2024年12月首都医科大学宣武医院与北京国际大数据交易所合作完成北京市首笔公立医院数据交易。此次交易涉及2500余例颈动脉支架手术病例涵盖疾病信息、检验检查、医学影像和治疗数据相关数据将用于国产颈动脉支架产品研发。值得关注的并不只是“医院数据完成了一笔交易”。更值得医院管理者和临床科室关注的是这批进入流通环节的数据并不是从医院信息系统中临时导出的一批原始病历而是在长期临床实践基础上形成的专病数据集并经过匿名化、数据清洗、整合和标准化处理。这一区别恰恰说明了临床数据从“资源”走向“资产”的关键所在。一、医院不缺数据真正稀缺的是能够持续利用的高质量数据很多医院尤其是大型三甲医院并不存在“没有数据”的问题。真正的问题是大量临床数据产生以后仍然分散在HIS、EMR、LIS、PACS以及随访表格、科研EXCEL等不同载体中。这些数据首先是为了完成诊疗过程而产生而不是按照某一科研问题、疾病队列或者产业应用需求设计的。这也是为什么病例数量不能直接等同于数据价值。一批数据能否真正用于临床研究、真实世界研究、预测模型开发乃至进一步的数据应用核心取决于它是否经历了持续、规范的数据治理。换句话说医院真正需要建设的不是一个“存病例的数据库”而是一套能够持续形成高质量临床研究数据的机制。二、宣武医院案例背后真正值得关注的是“专病数据集”宣武医院案例之所以具有代表性一个重要原因在于数据不是为一次交易临时准备的。医院依托长期开展的颈动脉支架手术和临床实践持续积累相关病例并形成了较为完整的颈动脉支架手术数据集。在进入进一步应用前又经过匿名化、清洗、整合和标准化处理。这意味着一批临床数据从产生价值到释放价值至少需要经历三个层次。第一层是临床数据的持续沉淀围绕一个疾病或者一类患者持续记录诊疗全过程。例如对于一个心血管专病队列真正有研究价值的数据往往不仅包括诊断结果还需要进一步覆盖人口学特征、既往史、危险因素、实验室检查、影像结果、治疗方案、手术信息、不良事件以及长期随访结局。只有形成连续的数据链条才能回答疾病发生、治疗反应和长期预后等问题。第二层是数据治理数据积累下来以后还要进一步解决标准、质量和合规问题。包括统一数据元和定义、规范疾病和操作编码、处理缺失和异常数据、建立逻辑核查规则、保留数据修改记录以及根据具体使用场景进行隐私保护和权限控制。在这个阶段原始诊疗数据才逐渐转化为能够被统计、被分析、被复用的研究数据。第三层才是数据应用完成前两个阶段后同一套专病数据可以进一步服务于不同研究问题。既可以开展回顾性队列研究也可以进一步开展真实世界研究、长期预后研究、危险因素分析如果样本量、变量质量和结局数据满足方法学要求还可以进一步开展临床预测模型研究。因此专病数据库的价值并不取决于一次项目能够产出什么而在于它是否能够成为一个持续产生研究问题和科研成果的数据底座。三、从“数据资源”到“数据资产”中间至少隔着一道数据治理近几年“数据资产”成为医疗行业的高频词。但对于医院而言数据资产化不应简单理解成“把医院数据拿去交易”。从目前的数据要素制度来看更准确的理解是在合法合规的前提下通过明确数据资源持有、加工使用以及数据产品经营等相关权益提升数据的可治理、可使用、可证明和可流通能力。2024年发布的《“数据要素”三年行动计划2024—2026年》已经将医疗健康列入12个重点领域并提出有序释放健康医疗数据价值、加强医疗数据融合创新。2026年7月《数据产权登记工作指引试行》正式印发进一步建立统一的数据产权登记规则。9月11日国家数据产权登记服务系统上线试运行数据产权登记开始进入全国统一制度落地阶段。国家数据局同时明确登记凭证可进一步应用于数据流通交易、数据资产入表、融资担保、作价入股、纠纷解决等场景。这些变化意味着一个非常现实的问题未来真正具有应用价值的临床数据需要从产生之初就考虑标准化、完整性、质量、权限、使用边界和可追溯性。如果数据长期以非结构化、非标准化方式沉积在不同系统里需要使用时再临时抽取、临时整理不仅科研效率低也很难形成稳定、可复用的数据资源。因此从医院和科室的角度看数据资产建设真正应该前移。不是等到出现数据交易或者成果转化需求以后再开始治理数据而是在专病数据库建设阶段就逐步形成规范的数据采集和治理体系。四、一套成熟专病库的价值专病库能支撑“数据库—研究—模型—成果”的连续转化这也是目前专病数据库建设正在发生的另一个变化。过去很多科室建库的目标比较单一——“先把病例收起来以后写文章用”。现在更成熟的建设思路开始从单一项目数据库转向长期疾病队列和学科数据基础设施。它的价值可以沿着一条相对清晰的路径不断延伸。第一步形成标准化专病数据库。围绕优势病种确定数据范围、核心变量、结局指标和随访周期逐步形成稳定的疾病队列。第二步形成可持续的临床研究能力。通过长期积累可以不断从临床数据中发现问题例如不同治疗路径的疗效差异、危险因素与疾病进展的关系、特定人群的长期预后等。在这一阶段数据库可以支撑回顾性研究、前瞻性队列研究、IIT及真实世界研究等不同研究设计。第三步进一步开展预测模型等成果研究。当数据库拥有相对完整的基线资料、临床指标和结局数据后可以进一步开展风险预测和预后研究。例如围绕疾病进展、术后并发症、再入院、复发、生存结局等临床问题通过合理的变量筛选和统计建模建立风险预测模型。需要特别强调的是预测模型只是数据应用的一种成果形式而不是建库的终点。真正高质量的数据库还可以继续支持模型外部验证、新研究假设验证、多中心研究以及后续科研项目申报。第四步反过来支撑学科建设。当一个科室长期围绕优势病种形成稳定的数据队列它能够支持的不只是论文数量。数据库可以进一步沉淀疾病谱特征、诊疗路径、疗效评价和患者长期结局为课题申报、多中心协作、临床研究平台建设以及优势病种研究方向形成提供基础。于是一条更完整的路径逐渐清晰临床诊疗→专病数据库→数据治理→研究队列→统计分析/预测模型→论文与课题→多中心研究与成果转化数据不再随着某一个科研项目结束而结束而是不断进入下一轮研究。这才是专病数据库真正具有长期价值的地方。五、专病数据库建设的难点从“有没有系统”转向“能不能持续形成高质量数据”现实中很多数据库最后没有真正使用起来并不是因为医院缺少软件。问题往往发生在更早的环节。例如建库初期没有明确研究目标指标设置过多不同人员对字段定义理解不一致历史病例整理高度依赖人工缺少持续随访只有基线数据没有结局质量问题没有及时发现项目几年以后已经无法追溯某个字段为什么被修改。因此一个能够长期运行的专病数据库至少需要同时解决四类问题标准化。明确核心数据元和定义使不同时间、不同人员甚至不同中心采集的数据可以进行比较。持续采集。降低临床数据整理和录入成本使数据库能够跟随诊疗过程持续更新而不是依赖一次性人工补录。质量控制。建立逻辑核查、质疑、修改、复核和操作留痕机制使数据质量能够被持续管理。长期随访。围绕疾病特点设计随访周期和结局指标。对于预测模型、预后研究和真实世界研究而言长期结局往往比单纯扩大病例数量更重要。六、领术智慧EDC围绕上述问题领术智慧EDC专病数据中心的设计重点并不是简单完成“病例存储”而是覆盖从建库、采集、治理、随访到科研应用的一系列环节。在数据标准层面平台参考国内外医疗数据标准建立数据体系涉及ICD-10、ICD-9-CM-3、LOING等标准并建立标准术语集、数据集和数据元体系为不同项目的数据标准化和后续科研协作提供基础。在数据采集环节平台可以借助自研AI大模型对病历及检查资料进行拍照识别和结构化录入录入时间可从5分钟/例提升至30秒/例提升10倍在数据质量管理环节通过系统质疑与人工核对相结合提升效率。针对长期队列建设平台同时支持随访计划、随访提醒以及多中心成员协作在数据安全和权限方面可按照团队、项目、中心设置权限并支持本地化部署和敏感信息脱敏。其核心目的是帮助科室形成一套可以持续运行的数据工作流从研究问题出发设计数据库在临床过程中持续沉淀结构化数据通过质控和稽查改善数据质量通过随访补充疾病长期结局最终再围绕数据库开展选题、统计分析和科研成果产出。领术智慧EDC可覆盖专病库方案设计、数据库建立、数据采集、稽查、统计分析到论文及科研项目等后续应用环节。结语宣武医院的案例提供了一个值得观察的样本。一批临床数据能够进入更高层次的应用并不是因为医院突然拥有了“数据资产”而是因为临床实践长期形成的数据经过了持续积累、专业治理和规范处理。从这个角度看数据资产并不是专病数据库建设之外突然出现的一个新概念。高质量专病数据库本身就是临床数据价值不断向上延伸的重要基础。对于医院和科室而言现在更值得思考的问题或许已经不是“我们有多少病例”而是这些病例能否持续形成标准、完整、可追溯的数据这些数据能否反复支撑新的临床问题和科研研究五年以后它们能否成为科室真正能够持续利用的数据基础从专病数据库到研究队列从研究队列到预测模型和科研成果再从科研数据走向更广泛的数据应用。这可能才是临床数据真正从“沉淀下来”走向“产生价值”的完整路径。