MiniMax H3 的 ComfyUI 工作流已经公开,真正容易卡住的通常不是提示词,而是环境、模型目录、端口和显存。
本文以一套预配置云端镜像为例,整理一条可重复的验收路径:
先确认 GPU 和 PyTorch,再确认模型文件,最后启动服务和排查 OOM。
1. 环境与目标
使用的镜像页面:
https://suanjiayun.com/mirror/6a7ed4efa207ada5e3465db6
截至 2026 年 8 月 15 日,页面标注如下:
| 项目 | 配置 |
|---|---|
| 镜像 | ComfyUI-v0.33.1-全能版-MiniMaxH3加速 |
| Ubuntu | 22.04.3 LTS |
| CUDA | 12.8 |
| Python | 3.12 |
| 镜像大小 | 37.28GB |
| 推荐显存 | 24GB |
| 推荐 GPU | RTX 4090 |
| 自动启动 | 支持 |
24GB 是镜像页面给出的推荐配置,不代表所有时长、分辨率和参考输入都经过验证。
本文最终要验收五件事:
- 系统识别到 GPU;
- PyTorch 能使用 CUDA;
- MiniMax H3 所需模型文件在正确目录;
- ComfyUI 正在监听 8080 端口;
- 浏览器可以访问,并能提交基础工作流。
不要跳着查。按层排查,出问题时比较容易知道是哪一块。
2. MiniMax H3 工作流由哪些模型组成
ComfyUI 官方模板当前引用了四类模型文件:
ComfyUI/ └── models/ ├── diffusion_models/ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors ├── text_encoders/ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors └── vae/ ├── minimax_h3_video_vae_fp16.safetensors └── minimax_h3_audio_vae_fp32.safetensors几个文件的职责不同:
diffusion_models:H3 的主扩散模型;text_encoders:理解提示词和多模态上下文的文本编码器;video_vae:视频潜空间的编码与解码;audio_vae:音频潜空间的编码与解码。
这不是传统的“一个 checkpoint 全包”结构。工作流能打开,不代表模型一定齐;模型文件存在,也不代表放在了 ComfyUI 能识别的目录。
3. 创建实例后先做只读检查
进入 WebSSH,先不要升级 CUDA、PyTorch 或 ComfyUI。
记录系统信息:
cat/etc/os-releasepython--versionconda info--envs查看磁盘空间:
df-h查看当前目录:
pwd预配置镜像出问题以后,最怕没有原始环境记录。至少先把上面几条命令的结果留一下,后面如果升级依赖失败,还知道原来是什么状态。
4. 验收 GPU 和 PyTorch
先检查 NVIDIA 驱动层:
nvidia-smi重点看四项:
- GPU 型号是否符合创建实例时的选择;
- 显存总量是否正常;
- 是否已有 Python 进程占用显存;
- 驱动是否正常返回,而不是
command not found或通信失败。
然后进入镜像环境:
conda activate comfyenv执行 PyTorch 检查:
python -<<'PY' import torch print("torch_version:", torch.__version__) print("torch_cuda_version:", torch.version.cuda) print("cuda_available:", torch.cuda.is_available()) print("device_count:", torch.cuda.device_count()) if torch.cuda.is_available(): print("device_name:", torch.cuda.get_device_name(0)) free_bytes, total_bytes = torch.cuda.mem_get_info(0) print("free_vram_gb:", round(free_bytes / 1024**3, 2)) print("total_vram_gb:", round(total_bytes / 1024**3, 2)) PY最低验收条件:
cuda_available: True device_count: 1 device_name: 实际 GPU 型号如果nvidia-smi正常,但torch.cuda.is_available()为False,优先检查:
- 当前是不是
comfyenv; python和pip是否来自同一环境;- PyTorch 是否为 CUDA 版本;
- 最近有没有手动升级过 PyTorch。
可以继续执行:
whichpythonpython-mpip--version两条路径应该落在同一个 Conda 环境中。
5. 核对模型文件和目录
进入 ComfyUI 目录:
cd~/ComfyUI2>/dev/null||cdComfyUI分别检查三个目录:
ls-lhmodels/diffusion_models/ls-lhmodels/text_encoders/ls-lhmodels/vae/也可以一次查找 H3 相关文件:
findmodels-typef\(\-name'minimax_h3*.safetensors'-o\-name'qwen3vl_32b_minimax_h3*.safetensors'\\)-printf'%p\n'预期至少能找到:
models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors models/vae/minimax_h3_video_vae_fp16.safetensors models/vae/minimax_h3_audio_vae_fp32.safetensors如果文件存在,但工作流下拉框仍然找不到,按顺序处理:
- 检查文件是否多套了一层目录;
- 检查文件名大小写;
- 检查下载文件是否为异常的小文件;
- 重启 ComfyUI,让它重新扫描模型目录。
可以查看四个文件实际占用:
du-h\models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors\models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors\models/vae/minimax_h3_video_vae_fp16.safetensors\models/vae/minimax_h3_audio_vae_fp32.safetensors不要只看文件名。下载中断后留下的同名小文件,也会让工作流加载失败。
6. 使用镜像脚本管理 ComfyUI
镜像提供了统一的控制脚本。
查看帮助:
./sj-run.sh-h启动:
./sj-run.sh-s停止:
./sj-run.sh-t重启:
./sj-run.sh-r如果镜像已经自动启动,不要连续执行多次启动命令。先查进程:
ps-ef|grep'[p]ython.*main.py'再查端口:
ss-lntp|grep':8080'如果能看到 Python 进程和 8080 监听,说明服务端已经起来。此时浏览器打不开,多半要查平台端口映射,而不是继续折腾 Python 环境。
7. 手动启动与本机连通性检查
镜像脚本启动失败时,可以先停掉已有进程,再手动运行:
./sj-run.sh-tconda activate comfyenvcd~/ComfyUI2>/dev/null||cdComfyUI python main.py--listen0.0.0.0--port8080--enable-cors-header这个终端先别关,直接看最后几十行输出。
另开一个 WebSSH 终端测试本机访问:
curl-I--max-time5http://127.0.0.1:8080/判断方法:
- 本机能访问、外部打不开:检查平台端口暴露和外部地址;
- 本机也打不开、没有端口监听:ComfyUI 没有正常启动;
- 端口存在但页面异常:查看启动终端的 Python 报错和前端资源错误。
--listen 0.0.0.0会让服务监听所有网卡,--enable-cors-header会放宽跨域访问。拿到的公网地址不要随便发到公开群里,尤其是工作流里包含私有素材时。
8. 导入工作流后的第一轮参数
MiniMax H3 官方模板说明中,原生画布以 768 像素短边为主,宽高需要是 32 的倍数,示例上限为 768×1344。视频按 24fps 处理,时长还会被换算成满足模型帧块规则的长度。
首次运行建议按这个顺序:
- 保留模板默认模型文件;
- 先跑较短时长;
- 先用较低分辨率;
- 不同时挂多个辅助模型;
- 第一次只验证一个输入路径;
- 成功后再增加首尾帧、参考图或参考视频。
这里不直接给“24GB 必须使用某组固定参数”,因为不同版本的节点、模型量化和工作流结构会改变峰值显存。没有实际运行记录时,写死一个万能参数反而容易误导。
9. 运行时记录显存峰值
提交任务前,先开一个监控终端:
nvidia-smi --query-gpu=timestamp,name,memory.used,memory.free,utilization.gpu\--format=csv-l1观察这些阶段:
- 模型加载前;
- 文本编码器加载后;
- 采样开始时;
- VAE 解码时;
- 任务结束后。
如果想把结果留档:
nvidia-smi --query-gpu=timestamp,name,memory.used,memory.free,utilization.gpu\--format=csv-l1|teeh3-gpu-monitor.csv任务完成后按Ctrl+C停止。
这份 CSV 比“4090 大概能跑”有用得多。后面调整分辨率、时长或参考输入时,可以直接对比峰值显存有没有变化。
10. OOM 怎么排查
常见错误包括:
CUDA out of memory或者进程直接被系统终止。
先执行:
nvidia-smi确认是否有其他进程占用显存。然后按这个顺序减负:
- 降低输出分辨率;
- 缩短视频时长;
- 减少参考输入;
- 关闭同时加载的其他模型;
- 重新启动 ComfyUI,释放残留显存;
- 仍然不够,再考虑更大显存的 GPU。
不要一看到 OOM 就重装 CUDA。OOM 首先是资源问题,不是安装问题。
如果任务结束后显存长期不释放,可以重启服务:
./sj-run.sh-r再用nvidia-smi确认占用是否回落。
11. 缺节点、版本冲突怎么处理
工作流出现红色节点时,先记录缺失节点的准确名称,不要直接把所有组件升级到最新版。
建议保存当前环境:
conda activate comfyenv python-mpip freeze>requirements-before-change.txt记录当前 ComfyUI 提交:
cd~/ComfyUI2>/dev/null||cdComfyUIgitrev-parse HEAD然后只处理缺失项。
预配置镜像里,ComfyUI、PyTorch、自定义节点和前端往往已经形成一套可运行组合。一次升级四五个组件,最后即使修好了,也不知道到底是哪一步起作用;如果坏了,同样不知道该回退谁。
12. 页面打不开时的排障表
| 现象 | 优先检查 | 常见原因 |
|---|---|---|
nvidia-smi失败 | GPU/驱动层 | 实例异常或驱动不可用 |
| PyTorch 返回 CUDA False | Conda/PyTorch 层 | 环境选错、CPU 版 PyTorch、依赖被覆盖 |
| 模型下拉框为空 | 文件层 | 文件缺失、目录错误、未重启扫描 |
| 8080 无监听 | ComfyUI 进程层 | 启动报错、进程退出、端口被改 |
| 本机能访问,公网不能 | 平台网络层 | 端口未暴露、外部 URL 不正确 |
| 运行中 OOM | 工作流资源层 | 分辨率、时长、参考输入或其他进程占用过高 |
| 生成后磁盘爆满 | 存储层 | 视频输出、缓存和模型持续增长 |
这张表基本就是整篇文章最重要的部分。
13. 数据保存和关机边界
视频模型的磁盘增长很快,除了模型文件,还有输入素材、预览缓存和最终视频。
建议至少定期检查:
du-sh~/ComfyUI/models2>/dev/nulldu-sh~/ComfyUI/input2>/dev/nulldu-sh~/ComfyUI/output2>/dev/null同时注意:关机停止的是 GPU 实例计算,扩容数据盘不一定随之停止计费。实例释放、数据盘保留和自动释放周期也应以平台最新帮助文档为准。
重要内容建议单独保存:
- 工作流 JSON;
- 使用过的提示词;
- 自定义节点清单;
requirements-before-change.txt;- 模型文件名与来源;
- 生成结果;
- 显存监控 CSV。
有这些东西,换实例以后才有可能快速恢复。只保存一张工作流截图,基本没用。
14. 最小验收清单
完成下面这些,再开始调正式任务:
nvidia-smi能识别正确 GPU;torch.cuda.is_available()返回True;- 四类 H3 模型文件可以找到;
- ComfyUI 进程存在;
- 8080 端口正在监听;
- 浏览器可以进入页面;
- 基础工作流可以提交;
- 音频和视频结果可以保存;
- 已记录一次显存峰值;
- 工作流与重要结果已经备份。
FAQ
RTX 4090 的 24GB 显存能跑 MiniMax H3 吗?
该镜像推荐 24GB 显存和 RTX 4090,适合作为基础工作流的起点。具体能否完成某组参数,要看分辨率、时长、参考输入和工作流中同时加载的模型。
官方说支持 2K,本地工作流为什么从 768 短边开始?
2K 是 MiniMax 公布的模型能力上限;ComfyUI 官方模板对本地工作流的原生画布、尺寸倍数和时长换算有单独说明。模型上限不能直接当作 24GB 显卡的默认参数。
页面打不开,是否需要重装 ComfyUI?
先查进程、8080 端口和平台端口映射。很多页面打不开的问题发生在网络暴露层,重装 ComfyUI 不会解决。
模型文件都在,为什么工作流还是找不到?
重点检查目录、文件名、文件完整性以及 ComfyUI 是否重新扫描。模型放在models根目录,而不是对应子目录,也可能无法识别。
是否应该马上升级到最新版 ComfyUI?
能运行时不建议盲目升级。先保存当前依赖和 Git 提交,再针对具体缺失节点或兼容问题做最小修改。
参考资料
- MiniMax H3 官方介绍:https://minimaxi.com/blog/minimax-h3
- ComfyUI 官方 MiniMax H3 工作流:https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json
- 算家云 MiniMax H3 镜像:https://suanjiayun.com/mirror/6a7ed4efa207ada5e3465db6