LIDC-IDRI:全球最大公开肺部CT结节标注数据库——1018例CT扫描、4名放射科医师双阶段独立标注、7371个结节的权威参考基准
摘要
**由美国国家癌症研究所(NCI)发起、美国国立卫生研究院基金会(FNIH)推动、FDA 积极参与,联合7 家学术中心(康奈尔大学、UCLA、芝加哥大学、爱荷华大学、密歇根大学、MD安德森癌症中心、纪念斯隆-凯特琳癌症中心)和8 家医疗影像公司(GE Healthcare、Philips Healthcare、Siemens Medical Solutions 等),历时近十年(2001—2010)共同创建了LIDC-IDRI 肺部CT结节参考数据库。该数据库包含1018 例胸部 CT 扫描,由 12 名经验丰富的胸部放射科医师经过盲读+非盲读双阶段标注,共标记7371 个结节病变,是全球医学影像计算机辅助诊断(CAD)研究领域最重要的公开参考基准之一。
意义:该数据库为肺结节 CAD 方法的开发、验证、比较及临床转化提供了统一的公共参考平台,消除了因数据库组成差异导致的研究结果不可比性,极大推动了肺部CT计算机辅助诊断技术的发展与临床落地。
一、研究背景
1、研究背景
医学影像计算机辅助诊断(CAD)技术自上世纪90年代起快速发展,尤其在乳腺X线摄影(mammography)领域,公开数据库(如DDSM)的建立极大加速了CAD算法的研究进程。然而,在胸部CT肺结节检测与分析这一更具临床挑战性的领域,研究界长期面临一个核心瓶颈——缺乏一个经过充分表征、附带专家标注"真值"的公共参考数据库。
肺结节是早期肺癌的重要影像学表现,CT扫描是目前检测肺结节最敏感的手段。随着低剂量CT肺癌筛查的推广,影像数据量呈指数级增长,放射科医师的工作负荷日益加重,CAD技术被视为辅助医师提高结节检出率、降低漏诊率的关键工具。然而,CAD算法的开发、训练和评估高度依赖大规模、高质量、附带专家共识标注的影像数据库。
在这一背景下,美国国家癌症研究所(NCI)于2000年4月发布研究申请公告(RFA),正式启动了"肺部影像数据库资源"项目,召集多家机构组建联盟,目标就是建立一个CT肺结节参考数据库,为CAD研究提供公共基准。
2、目前遇到的困难和挑战
挑战一:高质量标注影像数据的获取极其困难且昂贵。
为CAD研究收集合适的影像数据是一个既费力又昂贵的过程。研究者需要自行联系医院、获得伦理审批、从PACS系统中导出数据、进行匿名化处理,再请放射科医师逐例标注——这一套流程下来,往往需要数月甚至数年,且成本高昂。大多数研究团队无力独立完成,导致CAD研究进展缓慢。
挑战二:数据库组成差异导致不同CAD方法之间无法公平比较。
在没有公共数据库的情况下,各研究团队使用自己收集的私有数据集来评估算法性能,不同数据集在病例选择、扫描参数、结节大小分布、标注标准等方面存在巨大差异。这使得同一算法在不同数据集上的表现差异很大,不同算法之间也难以进行客观、公平的横向比较,严重阻碍了CAD技术的健康发展。
挑战三:缺乏统一的"真值"(ground truth)标注标准和流程。
CAD算法评估的核心是"真值"——即专家标注的结节位置、轮廓和特征。但不同放射科医师对同一病变的判断往往存在分歧:有人认为是结节,有人认为不是;有人觉得是恶性,有人认为是良性。如何通过合理的流程设计,在尊重医师个体差异的前提下,建立一套可复现、可信赖的真值标注体系,是一个尚未解决的方法学难题。此外,对于结节的"边界"定义、大小测量方式、恶性程度评级等,也缺乏行业统一标准。
二、介绍数据集
1、数据集名称
LIDC-IDRI 数据库(Lung Image Database Consortium and Image Database Resource Initiative Database)
2、一句话介绍数据集
LIDC-IDRI 是全球最大的公开胸部CT肺结节参考数据库,包含1018例CT扫描,由4名经验丰富的胸部放射科医师独立标注,共标记7371个结节病变,其中2669个结节≥3mm的病变附带有医师手绘轮廓和主观特征评级。
3、详细介绍数据
LIDC-IDRI 数据库共包含1018 例螺旋胸部CT扫描,来自1010 名不同患者(其中8名患者各有2例不同的扫描被无意中纳入),由7家学术机构从各自的PACS系统中回顾性收集。所有数据均经过严格的匿名化处理。
CT扫描参数范围广泛,涵盖多种设备和条件:
| 参数 | 详情 |
|---|---|
| 扫描设备 | GE LightSpeed系列(670例,7种型号)、Philips Brilliance系列(74例,4种型号)、Siemens Definition/Emotion/Sensation系列(205例,5种型号)、Toshiba Aquilion系列(69例) |
| 管电压 | 120 kV(818例)、130 kV(31例)、135 kV(69例)、140 kV(100例) |
| 管电流 | 40—627 mA(平均222.1 mA) |
| 层厚 | 0.6mm—5.0mm不等(最常见为1.25mm和2.5mm) |
| 重建间隔 | 0.45—5.0mm(平均1.74mm) |
| 像素尺寸 | 0.461—0.977mm(平均0.688mm) |
| 重建卷积核 | 软组织核(67例)、标准/非增强核(560例)、轻度增强核(264例)、过度增强核(127例) |
标注内容:
每例CT扫描附带一个XML 标注文件,记录了4名放射科医师的标注结果,包括:
- 结节≥3mm:附带有医师在每一层CT图像上手动或半自动绘制的结节轮廓(外边界),以及主观特征评级(细微度、内部结构、毛刺征、分叶征、球形度、实性程度、边缘特征、恶性可能性等)
- 结节<3mm:标记三维质心位置
- 非结节≥3mm:标记三维质心位置(如肺尖瘢痕等非结节病变)
核心数据统计:
| 统计项 | 数量 |
|---|---|
| 至少被1名医师标记为结节(≥3mm或<3mm)的病变 | 7371 |
| 至少被1名医师标记为结节≥3mm的病变 | 2669 |
| 被全部4名医师标记为结节≥3mm的病变 | 928(34.7%) |
| 被全部4名医师标记为同一类别(≥3mm或<3mm结节)的病变 | 1940(26.3%) |
| 仅被1名医师标记为结节的病变 | 744(10.1%) |
| 被全部4名医师以任意方式标记的结节 | 3396(46.1%) |
4、数据集构建
LIDC-IDRI 数据库的构建历时近十年,采用共识驱动的公私合作模式,经历了以下关键阶段:
第一阶段:联盟组建(2000—2001)
NCI 于2000年发布RFA,从申请者中选出5家学术机构(康奈尔、UCLA、芝加哥大学、爱荷华大学、密歇根大学)组建 LIDC 联盟。联盟的核心任务是制定CT肺结节数据库的共识指南。
第二阶段:联盟扩展(2004)
FNIH 于2004年创建 IDRI,新增2家学术中心(MD安德森癌症中心、纪念斯隆-凯特琳癌症中心)和8家医疗影像公司,形成7家学术中心+8家企业的公私合作格局。企业将数据库规模扩展至1000例CT扫描。
第三阶段:病例收集与匿名化
7家学术中心从各自PACS系统回顾性收集胸部CT扫描。每例扫描需满足:层厚/重建间隔≤3mm、结节最长径在3—30mm之间、每例扫描约6个结节以内。所有数据在本地机构和中央数据库层面进行了双重匿名化。
第四阶段:双阶段影像标注
这是整个数据库构建最核心的环节,12名放射科医师参与,每例扫描由来自4家不同机构的医师独立完成。
- 盲读阶段(Blinded Read):4名医师各自独立审阅CT扫描,标记病变为三类之一:结节≥3mm(附轮廓)、结节<3mm(附质心)、非结节≥3mm(附质心)。
- 非盲读阶段(Unblinded Read):4名医师的匿名盲读结果被汇总展示,每名医师在参考其他3人标注的基础上,独立修改自己的标注——可以保持不变、删除、更改类别或新增标记。
- 最终输出:每位医师在盲读+非盲读后,对所有结节≥3mm的病变进行主观特征评级,所有标注存储为XML文件。
第五阶段:质量控制
数据库实施了严格的质量保证(QA)协议,确保标注数据的完整性和一致性。
第六阶段:公开共享
数据库通过美国国家生物医学影像档案库(NBIA)向全球研究者免费开放,支持在线查询、子集筛选、批量下载。
5、数据集特点
特点一:多医师独立标注,保留分歧而非强制共识。
LIDC-IDRI 最大的特色是不追求强制共识。传统数据库通常要求多名医师达成一致后给出唯一标注,而 LIDC-IDRI 允许4名医师独立标注并保留各自意见。同一病变可能被不同医师赋予不同类别,甚至被某些医师忽略。这种设计使得研究者可以根据不同的"真值"定义(如至少1人标记 vs 全部4人标记)来评估CAD算法的性能,更真实地反映临床实际中的诊断不确定性。
特点二:丰富的多层次标注信息。
数据库不仅提供结节位置,还包含:
- 每一层CT上的结节轮廓(二维轮廓,可重建三维表面)
- 排除区域标注(如结节内的空腔)
- 多维主观特征评级(细微度、毛刺、分叶、球形度、实性程度、边缘、恶性可能性)
- 三维质心位置(用于<3mm结节和非结节病变)
特点三:扫描设备和参数的广泛多样性。
数据来自4家主要CT制造商(GE、Philips、Siemens、Toshiba)的16种不同型号扫描仪,覆盖不同的管电压(120—140kV)、管电流(40—627mA)、层厚(0.6—5.0mm)和重建算法。这种多样性使得基于该数据库开发的CAD算法具有更好的泛化能力。
特点四:严格的纳入/排除标准和匿名化流程。
每例扫描需满足层厚≤3mm的技术标准,结节大小限定在3—30mm范围。所有数据经过本地+中央双重匿名化,包括DICOM头信息和XML标注文件中的UID映射。
特点五:配套的辅助工具和文档支持。
NCI wiki页面提供了XML文件格式说明、放射科医师标注指南、结节大小度量标准、病理信息表格、空间分组软件等配套资源,方便研究者使用。
6、数据集使用方法
获取方式:
数据库通过美国国家生物医学影像档案库(NBIA)公开获取。用户在NBIA平台上可以:
- 在线查询和浏览CT影像
- 按条件筛选子集(如层厚<2mm的薄层扫描)
- 使用"共享列表"功能获取其他研究者创建的标准子集
- 批量下载DICOM影像和对应XML标注文件(zip压缩包)
使用注意事项:
- 引用规范:研究者发表论文时应明确说明使用了哪些病例,建议公布查询参数和纳入/排除标准,使用NBIA的"参考列表"功能以确保结果可复现
- 真值定义:必须明确说明如何从多名医师标注中提取真值(如取中位边界、质心并集、病理诊断等)
- 性能评估:需要详细描述评估方法(如ROC分析、FROC分析、Dice系数)以及判断CAD输出与真值一致的标准(如面积重叠>50%、质心间距<5mm等)
- 训练/测试划分:应完全公开训练集和测试集的划分方式
- 无盲法评估:数据库不支持盲法评估(即不提供预设的训练/测试集隔离),研究者需自行划分
配套资源:
- NIH wiki页面(https://wiki.nci.nih.gov/display/CIP/LIDC):提供XML格式说明、标注指南、病理信息、空间分组软件等
- 预定义的共享列表:如"LIDC_thin_slice"(层厚≤2mm的病例子集)
7、基准测试总结
在2669个被至少1名医师标记为结节≥3mm的病变中,仅34.8%(928个)获得了全部4名放射科医师的一致标记,凸显了肺结节影像判读中显著的专家间变异性,也为CAD算法的性能评估设定了现实的基准上限。
三、数据集应用场景
1、肺结节自动检测算法的开发与训练
这是最直接的用途。做CAD的团队可以拿这1018例CT扫描来训练深度学习模型或传统图像分析算法,让算法学会"看"CT图像并自动找出可能是肺结节的区域。因为数据库里有4名医师各自标注的结节位置,开发者可以选择不同的"真值"标准来训练——比如用"至少1人标记"作为宽松标准,或者用"全部4人都标记"作为严格标准,看算法在不同标准下表现如何。
2、肺结节良恶性分类研究
找到了结节之后,更关键的问题是:这个结节是良性的还是恶性的?LIDC-IDRI 数据库里每个≥3mm的结节都附带了医师对恶性可能性的主观评级,研究者可以基于这些评级,结合结节的影像特征(大小、形状、边缘、密度等),开发自动分类算法。比如用深度学习提取结节影像特征,再跟医师的恶性评级做对比,训练一个"AI读片助手"来辅助判断结节性质。
3、结节分割与定量测量
CAD不仅要找到结节,还要精确测量它的大小、体积和形态。数据库里医师手绘的结节轮廓就是分割算法的"金标准"。研究者可以开发自动分割算法,然后跟医师的轮廓做对比,用Dice系数之类的指标来评估分割精度。还可以做结节体积测量、增长率分析等定量研究,这对于评估结节是否在长大(恶性征兆)非常重要。
4、不同CAD算法的公平比较与基准测试
以前各个团队用自己的私有数据集,你报你的准确率,我报我的准确率,根本没法比。有了LIDC-IDRI,大家都在同一个数据集上跑算法,结果就有了可比性。论文里专门强调了要公布用了哪些病例、怎么划分训练测试集、怎么定义真值,就是为了让比较更公平、结果可复现。
5、放射科医师读片一致性(观察者间变异性)研究
这个数据库天然就是一个研究"医师之间判读差异有多大"的宝库。4名医师独立标注,分歧一目了然。研究发现,只有34.8%的结节≥3mm获得了4人一致认可——这说明即使是经验丰富的胸部放射科医师,对同一病变也经常有不同看法。这类研究可以帮助我们理解医师读片的认知过程,为制定更规范的影像判读标准提供依据。
6、AI模型的泛化能力评估
数据库来自4家不同厂商(GE、Philips、Siemens、Toshiba)的16种不同型号CT扫描仪,扫描参数差异很大。如果你的算法只在GE的扫描仪上效果好,换到Siemens就不行了,那说明泛化能力不够。LIDC-IDRI的设备多样性让研究者可以测试算法在不同设备、不同扫描条件下的表现,推动算法更加鲁棒。
7、FDA/监管机构审批的参考基准
论文提到FDA全程参与了这个项目。这意味着基于LIDC-IDRI数据库验证的CAD算法,在向FDA申请医疗器械审批时,评估结果更容易被认可。数据库为CAD产品的监管审批提供了一个标准化的性能评估平台,加速了AI辅助诊断工具从实验室走向临床的进程。
8、结节特征与病理结果的关联分析
数据库中部分结节有病理诊断信息(活检或手术结果),研究者可以把影像特征(如毛刺、分叶、密度等)跟病理结果关联起来,找出哪些影像特征最有助于区分良恶性结节。这种"影像组学"研究可以帮助开发更精准的预测模型。
9、低剂量CT筛查效果评估
数据库包含了标准剂量和低剂量CT扫描,研究者可以比较不同剂量条件下结节的检出率和测量精度,为优化低剂量CT肺癌筛查方案提供数据支持。
10、结节概率图与不确定性量化
数据库提供了从4名医师标注中生成结节概率图的工具,研究者可以量化"这个区域是结节的概率有多大"。这种不确定性信息对于开发可信赖的AI系统非常重要——AI不仅要给出判断,还要告诉医生"我有多确定"。
相关资源
本文是 LIDC-IDRI 数据集的详细解读。对于做医疗 AI 的朋友,数据集选型往往是个痛点——不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中,查阅成本很高。
我们把 LIDC-IDRI 以及全球主流医疗 AI 数据集(涵盖 CT、MRI、病理、超声、多模态等)整理成了 AI-Ready Dataset 条目库,以统一的 Wikipedia 式结构呈现,方便研究者快速比对和选型:
Qianfanghub AI-Ready Dataset:https://www.qianfanghub.com/ai-ready-dataset/
#LIDC-IDRI数据集、#肺结节CT影像、#计算机辅助诊断CAD、#医学影像公开数据库、
#NCI美国癌症研究所