V100 32G 全参数训练完整说明
先讲核心结论:V100 32G 几乎无法做主流大模型全参数训练,仅能极小参数量模型裸训;7B/13B/30B 只能 LoRA 微调,不能全量训练
一、基础概念区分
- 全参数训练(全量训练)冻结任何层,模型所有权重、梯度、优化器参数全部存入显存,显存占用极高。
- LoRA 微调冻结基座大模型,仅训练少量低秩矩阵,显存需求大幅降低(前文方案)。
二、显存占用参考(单卡 V100 32G,不含梯度累积、梯度检查点)
FP16/BF16 全参数裸训,显存三部分构成:模型权重 + 梯度缓存 + 优化器缓存(AdamW 占用最大)
- 1B 以内小模型(几百 M 参数) 权重≈2GB,全量训练总占用≈8~12GB ✅V100 32G 可完整全参数训练适用:小型分类模型、简易 TextCNN、单层 LSTM、微型对话模型
- 3B 模型 权重≈6GB,Adam 全量训练总占用≈22~28GB 勉强塞下,但无显存余量,无法加数据集缓存、无法开长上下文,极易 OOM
- 7B 模型 FP16 权重 13GB,Adam 全参数训练总需求 45G + 显存 ❌32G 显存完全不够,无法单卡全参数训练
- 13B/30B 全参数训练显存需求 60G/130G 起步,单卡 V100 完全不具备条件