ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

VoxelFM:学习稳健的 CT 视觉特征,实现面向临床任务的高效迁移

VoxelFM:学习稳健的 CT 视觉特征,实现面向临床任务的高效迁移 论文Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks作者Rubén Moreno-Aguado、Alba Magallón、Victor Moreno、Yingying Fang、Guang YangarXiv2604.04133v12026-04-05cs.CV原文arXiv HTML代码与权重rmaguado/VoxelFM证据边界本文总结的是论文正文中作者报告的结果未在本地独立下载权重、数据或复现实验。一句话总结VoxelFM 是一个不使用影像—报告配对文本、而是用 DINO 风格自蒸馏学习的 3D CT 基础模型。作者将骨干网络冻结只训练轻量级 probe在分类、回归、生存分析、定位、分割、报告生成和实例检索七类任务上进行评估。论文的核心结论是在当前 CT 数据规模下基础模型首先应当成为稳健的视觉特征提取器而不是优先追求端到端的视觉语言生成器。1. 研究动机与问题定义现有 CT 基础模型常把目标设为通用视觉语言模型但可靠的视觉语言预训练需要大量高质量、成对的 CT 与放射科报告而这类数据在 CT 领域仍然有限。另一个现实问题是许多模型迁移到新任务时需要部分或完整地微调骨干计算和显存成本较高也容易在小规模标注集上过拟合。作者提出的替代路线是用大量未配对 CT 影像进行自监督预训练学到同时包含全局语义和局部空间信息的 3D 表征下游任务固定骨干仅训练 MLP、Q-Former 或轻量解码器通过小规模标注验证“少数据、低计算”的迁移能力。2. VoxelFM 的方法2.1 预训练数据与预处理预训练共使用137,107 例去标识化 CT覆盖头颈、胸部和腹部来自 CT-RATE、Merlin、NLST 以及 TCIA 等公开数据集。用于下游测试的数据划分被排除在预训练之外CT-RATE 和 Merlin 只使用官方训练划分专门用于评估的 TCIA 数据集不参与预训练。主要预处理包括重采样为各向同性体素间距保留最小间距维度并将最大体积边长限制为 768 个体素将 HU 值裁剪到[-1000, 1900]使用预训练全集统计量进行全局 z-score 标准化去除空气、扫描床等非患者背景以节省显存和计算。训练数据按临床区域大致分布如下肺部数据包括 CT-RATE 25,692、INSPECT 23,203、NLST 13,587腹部数据包括 Merlin 15,331、RSNA-ABT 4,274 等头颈数据包括 RADCURE 3,346、HNSCC 1,171 等另有 TotalSegmentator 全身 CT 1,092 例。论文表 2 给出的总数为 137,107。2.2 DINO、iBOT 与 KoLeo 的组合每个 CT 样本生成两个 global crops覆盖原体积的 30%–100%和八个 local crops覆盖 5%–30%。teacher 网络处理 global cropsstudent 网络处理 global 与 local crops。训练目标由三部分组成DINO loss让 student 的 class token 表征匹配 teacher 的 global-view 表征iBOT loss对 student global crops 的 50% patch token 做随机遮挡并预测 teacher 对应 patch 的分布KoLeo loss鼓励 batch 内的表示保持多样性减少表示坍塌。teacher 参数通过 student 参数的指数移动平均更新。数据增强包括 HU 窗宽扰动、轴向翻转、随机 3D crop 和切片顺序随机置换。teacher 输出还通过中心化与温度为 0.07 的 softmax 锐化来稳定训练。2.3 网络结构与训练规模VoxelFM 使用 3D Vision Transformerpatch size14 × 14 × 14voxelembedding dimension864Transformer block12 层attention heads每层 12 个MLP expansion ratio43D rotary positional embedding4 个 register tokensprojection head三层 MLP隐藏维度 2048256 维 bottleneck65,536 个 prototypes。训练在 8 张 48 GB 的 L40S GPU 上进行使用分布式数据并行。每张 GPU 每步处理 16 个样本梯度累积 16 次有效 batch size 为 2048总预训练步数为 100,000。3. 下游评估协议作者将骨干参数全部冻结先缓存 embedding再为每类任务训练轻量 probe分类/回归class token 使用两层 MLPpatch tokens 使用单层 Q-Former实例检索用 class token 的余弦相似度排序定位用多头自注意力和 softmax 加权 token 坐标解码 3D 中心点分割将 patch tokens 重排成 3D 特征图接 3D 卷积与上采样解码器报告生成patch tokens 经 Q-Former 投影后接入 LLaVA 式多模态框架。数据按患者划分避免同一患者同时出现在训练、验证和测试集。根据任务选择验证指标并保存最佳 checkpoint。AUROC 的标准误使用 Hanley–McNeil 方法MAE、C-index、DICE 和 F1 用 10,000 次 prediction-level bootstrap 得到 95% 区间基线比较使用 t-test显著性阈值为p 0.05。4. 主要结果下表整理论文表 1 中的 VoxelFM 结果括号内为标准误。结果均为论文报告值。任务数据集指标VoxelFM与基线比较分类CT-RATEAUROC0.870 (0.006)高于 Merlin 0.798p9.9×10^-18分类MerlinAUROC0.797 (0.005)略低于 Merlin 0.810差异不显著p0.067分类RSNA-STRAUROC0.760 (0.017)高于 Merlin 0.597p1.0×10^-10分类MycobacterialAUROC0.799 (0.031)与其他模型接近p0.50分类iCTCF-CovidAUROC0.845 (0.027)高于下一模型p0.049分类iCTCF-SeverityAUROC0.792 (0.054)优势不显著p0.61回归OSICMAE↓0.591 (0.041)低于 RadFM 0.693p0.20生存分析NSCLC-RadiomicsAUROC0.650 (0.083)其他基线接近或低于随机水平生存分析NSCLC-RadiomicsC-index0.602 (0.051)仅 VoxelFM 显著高于随机水平与 Merlin 差异p0.30定位LUNA16MAE↓0.100 (0.004)约 8.4 mmMerlin 约 19.7 mmp1.2×10^-86分割TotalSegmentatormicro-DICE0.889 (0.007)与 M3D 0.883 差异不显著p0.59分割TotalSegmentatormacro-DICE0.594 (0.015)高于 M3D 0.537p0.016分割Mediastinalmicro-DICE0.311 (0.043)高于 M3D 0.196p0.060分割AirRCmicro-DICE0.579 (0.029)低于 CT-CLIP 0.601p0.57报告生成CT-RATEmacro-F10.432 (0.018)高于 Merlin 0.327p5.2×10^-5实例检索CT-RATERecall100.133 (0.006)仅略高于随机基线 0.1004.1 分类六个基准中的五个取得最高 AUROCVoxelFM 在六个分类基准中的五个取得最高 AUROC。最明显的提升出现在肺栓塞检测 RSNA-STR0.760 对 Merlin 的 0.597。作者认为肺栓塞往往只出现在体积中的局部区域因此该任务检验了 patch-level 表征而不是简单的全局疾病存在性。Merlin 数据集是一个重要的例外VoxelFM 得分 0.797略低于 Merlin 的 0.810。作者指出Merlin 本身用放射科报告和诊断代码进行对比学习而且其评估标签直接来自相关报告因此在自己的数据分布上具有先验优势。4.2 生存预测只有 VoxelFM 超过随机水平在仅有 356 例 CT 的 NSCLC-Radiomics 生存任务上VoxelFM 使用 class token 和 Cox 比例风险模型。其三年生存 AUROC 为 0.650C-index 为 0.602其他基线的 C-index 均低于或接近随机水平。这里的结果支持一个较强但仍需谨慎解释的结论自监督视觉表征可能包含与预后相关的信息但该差异并没有在 VoxelFM 与 Merlin 的 C-index 比较中达到显著性。4.3 定位与分割patch tokens 携带空间信息LUNA16 肺结节定位的归一化 MAE 为 0.100对应约 8.4 mm明显优于 Merlin 的 19.7 mm。TotalSegmentator 上 micro-DICE 为 0.889macro-DICE 为 0.594macro-DICE 的优势更大说明对低频组织类别的表征可能更稳健。AirRC 是一个例外CT-CLIP 得分 0.601高于 VoxelFM 的 0.579。该数据集集中于气道和血管接近 CT-CLIP 的胸部预训练分布差异并不显著。作者强调VoxelFM 的分割实验意在证明表征具备空间和结构信息不是要替代专门的 TotalSegmentator 类模型。4.4 报告生成比其他模型好但仍不如分类器报告生成采用 LLaVA 风格模块Q-Former 将 patch tokens 转成多模态输入Qwen3-8B 作为语言模型使用 LoRArank 128、alpha 256。GPT-OSS 120B 被用于将 CT-RATE 报告整理成统一格式。VoxelFM 的报告生成 macro-F1 为 0.432优于 Merlin 0.327、RadFM 0.259、M3D 0.270 和 CT-CLIP 0.197。然而作者进一步把生成报告中的 18 类异常重新分类发现每一个异常类别上直接训练的二分类 probe 都优于报告生成器。因此“报告生成分数最高”不能等价于“已经适合临床报告自动化”。4.5 数据效率小规模标注即可达到可用结果在 iCTCF-Covid 上使用 20% 的训练数据184 个样本时VoxelFM AUROC 为 0.74使用全部数据时为 0.81。作为比较Merlin 从全量数据的 0.76 降至 20% 数据时的 0.54。RSNA-STR 更困难20% 数据1,019 个样本时 AUROC 为 0.63全量数据时为 0.76。这说明“少量标注即可迁移”依赖任务难度局部、小病灶任务仍然需要更多标注来训练 patch-level probe。4.6 class token 与 patch tokens 的选择规律三个较小数据集iCTCF-Covid、iCTCF-Severity、Mycobacterial上class-token MLP 更好三个较大数据集RSNA-STR、CT-RATE、Merlin上patch-token Q-Former 更好。直观上class token 维度较低在标注稀缺时更不易过拟合patch tokens 包含更多局部信息但也需要更多样本学习一个可靠的 probe。4.7 体积处理灵活性作者比较了完整 3D 推理和分块的 2.5D 推理。各分类任务上的 AUROC 基本一致说明模型不要求固定的单一输入大小超大体积可以分块以降低显存占用完整体积则保留更充分的 3D 上下文。4.8 实例检索几乎接近随机在 CT-RATE 的检索设置中每个查询包含一个阳性样本和 99 个阴性样本随机 Recall10 为 0.100VoxelFM 只有 0.133。作者认为全局 embedding 会同时受到扫描仪厂商、采集协议、重建核、人口学特征和扫描范围影响余弦相似度可能更像是在检索“成像条件相似”的病例而不是“病理相似”的病例。因此论文不支持直接把这类 embedding 检索用于临床病例搜索。5. 论文贡献的准确解读5.1 贡献一把 CT 基础模型的目标从“生成”转向“迁移表征”论文最重要的主张不是某一个 AUROC 数值而是评估范式先训练稳健、可泛化的 CT 视觉表征再用任务专用的轻量头完成适配。这个范式降低了计算门槛也让分类、定位、分割和生存分析能共享同一骨干。5.2 贡献二语言监督并非在当前规模下必然更优VoxelFM 没有在预训练阶段看报告却在报告生成和多个结构化任务上超过语言对齐模型。论文的解释是在十万量级 CT 而非互联网级数据规模下视觉自监督信号可能比有限、噪声较大的报告文本提供更高效的学习信号。作者同时承认尚缺乏在更大规模配对 CT—报告数据上的系统比较。5.3 贡献三全局与局部 token 形成实用的任务分工class token 适合小数据、全局任务patch tokens 适合数据充足且需要细粒度空间信息的任务。这一结论比“所有任务统一使用某个 token”更适合作为迁移实践中的默认起点。6. 局限与需要避免的过度结论没有公平比较所有模型的完整骨干微调能力。论文只在冻结骨干下比较因此基线模型的潜力可能被低估如果允许更多标注和计算性能差距可能缩小。预训练数据分布刻画不充分。作者没有系统报告扫描仪厂商、采集协议、患者人口学和病理比例因此跨医院分布偏移风险仍难以预测。公开数据不等于完全可直接复现。论文称代码和权重公开但部分头颈数据需要受限访问不同数据集的许可、下载和预处理仍需逐一核对。临床有效性尚未建立。评估使用公开基准和轻量 probe没有前瞻性临床验证也没有证明可直接进入临床流程。报告生成结果的解释有限。F1 是将生成报告再分类后得到的异常标签 F1不是完整报告的临床事实性、遗漏率、语言质量或医生可接受性评分。统计检验仍需谨慎。论文对多任务、多基线比较使用 t-test多重比较校正、外部医院验证和更严格的校准分析未见系统展开。实例检索失败说明 embedding 不能直接当作病例数据库索引。还需要病理条件化、协议校正或专门的检索训练。7. 对 CT/医疗 AI 项目的实践启示7.1 先做结构化任务再做自由文本生成如果目标是异常检测、分期、器官/病灶定位或分割应优先冻结 VoxelFM 并训练任务专用 probe建立可靠的 AUROC、敏感度、特异度、DICE、定位误差和校准结果。报告生成可以作为后续研究模块但不应把表面流畅的文本当成结构化预测的替代品。7.2 按标注规模选择 token标注量较小先用 class token MLP控制参数量和过拟合标注量较大、病灶局部性强尝试 patch tokens Q-Former 或空间解码器定位/分割直接使用 patch tokens不要只依赖全局 class token。7.3 把“冻结骨干”作为可复现的第一阶段冻结骨干有三个工程好处缓存 embedding 后可快速迭代多个任务显存和训练成本较低不同任务之间的比较更容易归因于 probe 和数据而不是骨干同时变化。之后再用严格的外部验证决定是否值得进行骨干微调。7.4 迁移到脊柱或其他专科时必须重做验证论文覆盖的区域以头颈、胸部和腹部为主不能直接把结果外推到脊柱 CT/MR。专科迁移至少需要检查扫描协议与层厚是否落在预训练分布附近目标病变是全局信号还是小范围局部信号是否存在跨设备、跨医院和跨人群分布偏移标签是否按患者划分并避免同一患者泄漏是否同时报告外部测试、置信区间、校准和失败案例。8. 推荐的复现实验清单按代码仓库说明下载权重确认 checkpoint、预处理和输入尺寸先复现一个小型分类任务再复现定位或 TotalSegmentator 子集固定患者级 train/validation/test 划分记录每个数据集实际样本数对 class token 与 patch tokens 分别训练 probe复现论文的 20%–100% 标注量曲线报告均值、标准误、95% 区间和每个类别的结果而不只报告宏平均对报告生成单独评估事实性、遗漏和幻觉不把再分类 F1 当成完整临床报告质量在目标医院或目标设备上做外部验证再讨论临床部署。9. 总结VoxelFM 的核心价值在于展示了一条务实的 CT 基础模型路线用大规模无语言监督的 3D 自蒸馏学习视觉特征把骨干冻结后交给轻量 probe 迁移。论文报告的结果显示这条路线在多种结构化任务、低标注场景和细粒度空间任务上具有竞争力尤其是分类、肺结节定位和全身组织分割。同时论文也给出了清晰的边界报告生成即使超过其他视觉语言模型仍不如直接的二分类器可靠实例检索几乎接近随机数据分布、外部泛化和完整微调比较仍不充分。因此较稳妥的工程结论是把 VoxelFM 当作通用 CT 特征骨干和迁移学习起点而不是已经完成临床验证的自动报告或病例检索系统。参考来源Moreno-Aguado et al., “Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks,” arXiv:2604.04133v1.VoxelFM 代码与预训练权重入口https://github.com/rmaguado/VoxelFM.
返回列表