三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

云端部署 MiniMax H3 ComfyUI:环境验收、模型目录与故障排查

云端部署 MiniMax H3 ComfyUI:环境验收、模型目录与故障排查

MiniMax H3 的 ComfyUI 工作流已经公开,真正容易卡住的通常不是提示词,而是环境、模型目录、端口和显存。

本文以一套预配置云端镜像为例,整理一条可重复的验收路径:

先确认 GPU 和 PyTorch,再确认模型文件,最后启动服务和排查 OOM。

1. 环境与目标

使用的镜像页面:

https://suanjiayun.com/mirror/6a7ed4efa207ada5e3465db6

截至 2026 年 8 月 15 日,页面标注如下:

项目配置
镜像ComfyUI-v0.33.1-全能版-MiniMaxH3加速
Ubuntu22.04.3 LTS
CUDA12.8
Python3.12
镜像大小37.28GB
推荐显存24GB
推荐 GPURTX 4090
自动启动支持

24GB 是镜像页面给出的推荐配置,不代表所有时长、分辨率和参考输入都经过验证。

本文最终要验收五件事:

  1. 系统识别到 GPU;
  2. PyTorch 能使用 CUDA;
  3. MiniMax H3 所需模型文件在正确目录;
  4. ComfyUI 正在监听 8080 端口;
  5. 浏览器可以访问,并能提交基础工作流。

不要跳着查。按层排查,出问题时比较容易知道是哪一块。

2. MiniMax H3 工作流由哪些模型组成

ComfyUI 官方模板当前引用了四类模型文件:

ComfyUI/ └── models/ ├── diffusion_models/ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors ├── text_encoders/ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors └── vae/ ├── minimax_h3_video_vae_fp16.safetensors └── minimax_h3_audio_vae_fp32.safetensors

几个文件的职责不同:

  • diffusion_models:H3 的主扩散模型;
  • text_encoders:理解提示词和多模态上下文的文本编码器;
  • video_vae:视频潜空间的编码与解码;
  • audio_vae:音频潜空间的编码与解码。

这不是传统的“一个 checkpoint 全包”结构。工作流能打开,不代表模型一定齐;模型文件存在,也不代表放在了 ComfyUI 能识别的目录。

3. 创建实例后先做只读检查

进入 WebSSH,先不要升级 CUDA、PyTorch 或 ComfyUI。

记录系统信息:

cat/etc/os-release
python--version
conda info--envs

查看磁盘空间:

df-h

查看当前目录:

pwd

预配置镜像出问题以后,最怕没有原始环境记录。至少先把上面几条命令的结果留一下,后面如果升级依赖失败,还知道原来是什么状态。

4. 验收 GPU 和 PyTorch

先检查 NVIDIA 驱动层:

nvidia-smi

重点看四项:

  • GPU 型号是否符合创建实例时的选择;
  • 显存总量是否正常;
  • 是否已有 Python 进程占用显存;
  • 驱动是否正常返回,而不是command not found或通信失败。

然后进入镜像环境:

conda activate comfyenv

执行 PyTorch 检查:

python -<<'PY' import torch print("torch_version:", torch.__version__) print("torch_cuda_version:", torch.version.cuda) print("cuda_available:", torch.cuda.is_available()) print("device_count:", torch.cuda.device_count()) if torch.cuda.is_available(): print("device_name:", torch.cuda.get_device_name(0)) free_bytes, total_bytes = torch.cuda.mem_get_info(0) print("free_vram_gb:", round(free_bytes / 1024**3, 2)) print("total_vram_gb:", round(total_bytes / 1024**3, 2)) PY

最低验收条件:

cuda_available: True device_count: 1 device_name: 实际 GPU 型号

如果nvidia-smi正常,但torch.cuda.is_available()False,优先检查:

  1. 当前是不是comfyenv
  2. pythonpip是否来自同一环境;
  3. PyTorch 是否为 CUDA 版本;
  4. 最近有没有手动升级过 PyTorch。

可以继续执行:

whichpython
python-mpip--version

两条路径应该落在同一个 Conda 环境中。

5. 核对模型文件和目录

进入 ComfyUI 目录:

cd~/ComfyUI2>/dev/null||cdComfyUI

分别检查三个目录:

ls-lhmodels/diffusion_models/
ls-lhmodels/text_encoders/
ls-lhmodels/vae/

也可以一次查找 H3 相关文件:

findmodels-typef\(\-name'minimax_h3*.safetensors'-o\-name'qwen3vl_32b_minimax_h3*.safetensors'\\)-printf'%p\n'

预期至少能找到:

models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors models/vae/minimax_h3_video_vae_fp16.safetensors models/vae/minimax_h3_audio_vae_fp32.safetensors

如果文件存在,但工作流下拉框仍然找不到,按顺序处理:

  1. 检查文件是否多套了一层目录;
  2. 检查文件名大小写;
  3. 检查下载文件是否为异常的小文件;
  4. 重启 ComfyUI,让它重新扫描模型目录。

可以查看四个文件实际占用:

du-h\models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors\models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors\models/vae/minimax_h3_video_vae_fp16.safetensors\models/vae/minimax_h3_audio_vae_fp32.safetensors

不要只看文件名。下载中断后留下的同名小文件,也会让工作流加载失败。

6. 使用镜像脚本管理 ComfyUI

镜像提供了统一的控制脚本。

查看帮助:

./sj-run.sh-h

启动:

./sj-run.sh-s

停止:

./sj-run.sh-t

重启:

./sj-run.sh-r

如果镜像已经自动启动,不要连续执行多次启动命令。先查进程:

ps-ef|grep'[p]ython.*main.py'

再查端口:

ss-lntp|grep':8080'

如果能看到 Python 进程和 8080 监听,说明服务端已经起来。此时浏览器打不开,多半要查平台端口映射,而不是继续折腾 Python 环境。

7. 手动启动与本机连通性检查

镜像脚本启动失败时,可以先停掉已有进程,再手动运行:

./sj-run.sh-tconda activate comfyenvcd~/ComfyUI2>/dev/null||cdComfyUI python main.py--listen0.0.0.0--port8080--enable-cors-header

这个终端先别关,直接看最后几十行输出。

另开一个 WebSSH 终端测试本机访问:

curl-I--max-time5http://127.0.0.1:8080/

判断方法:

  • 本机能访问、外部打不开:检查平台端口暴露和外部地址;
  • 本机也打不开、没有端口监听:ComfyUI 没有正常启动;
  • 端口存在但页面异常:查看启动终端的 Python 报错和前端资源错误。

--listen 0.0.0.0会让服务监听所有网卡,--enable-cors-header会放宽跨域访问。拿到的公网地址不要随便发到公开群里,尤其是工作流里包含私有素材时。

8. 导入工作流后的第一轮参数

MiniMax H3 官方模板说明中,原生画布以 768 像素短边为主,宽高需要是 32 的倍数,示例上限为 768×1344。视频按 24fps 处理,时长还会被换算成满足模型帧块规则的长度。

首次运行建议按这个顺序:

  1. 保留模板默认模型文件;
  2. 先跑较短时长;
  3. 先用较低分辨率;
  4. 不同时挂多个辅助模型;
  5. 第一次只验证一个输入路径;
  6. 成功后再增加首尾帧、参考图或参考视频。

这里不直接给“24GB 必须使用某组固定参数”,因为不同版本的节点、模型量化和工作流结构会改变峰值显存。没有实际运行记录时,写死一个万能参数反而容易误导。

9. 运行时记录显存峰值

提交任务前,先开一个监控终端:

nvidia-smi --query-gpu=timestamp,name,memory.used,memory.free,utilization.gpu\--format=csv-l1

观察这些阶段:

  • 模型加载前;
  • 文本编码器加载后;
  • 采样开始时;
  • VAE 解码时;
  • 任务结束后。

如果想把结果留档:

nvidia-smi --query-gpu=timestamp,name,memory.used,memory.free,utilization.gpu\--format=csv-l1|teeh3-gpu-monitor.csv

任务完成后按Ctrl+C停止。

这份 CSV 比“4090 大概能跑”有用得多。后面调整分辨率、时长或参考输入时,可以直接对比峰值显存有没有变化。

10. OOM 怎么排查

常见错误包括:

CUDA out of memory

或者进程直接被系统终止。

先执行:

nvidia-smi

确认是否有其他进程占用显存。然后按这个顺序减负:

  1. 降低输出分辨率;
  2. 缩短视频时长;
  3. 减少参考输入;
  4. 关闭同时加载的其他模型;
  5. 重新启动 ComfyUI,释放残留显存;
  6. 仍然不够,再考虑更大显存的 GPU。

不要一看到 OOM 就重装 CUDA。OOM 首先是资源问题,不是安装问题。

如果任务结束后显存长期不释放,可以重启服务:

./sj-run.sh-r

再用nvidia-smi确认占用是否回落。

11. 缺节点、版本冲突怎么处理

工作流出现红色节点时,先记录缺失节点的准确名称,不要直接把所有组件升级到最新版。

建议保存当前环境:

conda activate comfyenv python-mpip freeze>requirements-before-change.txt

记录当前 ComfyUI 提交:

cd~/ComfyUI2>/dev/null||cdComfyUIgitrev-parse HEAD

然后只处理缺失项。

预配置镜像里,ComfyUI、PyTorch、自定义节点和前端往往已经形成一套可运行组合。一次升级四五个组件,最后即使修好了,也不知道到底是哪一步起作用;如果坏了,同样不知道该回退谁。

12. 页面打不开时的排障表

现象优先检查常见原因
nvidia-smi失败GPU/驱动层实例异常或驱动不可用
PyTorch 返回 CUDA FalseConda/PyTorch 层环境选错、CPU 版 PyTorch、依赖被覆盖
模型下拉框为空文件层文件缺失、目录错误、未重启扫描
8080 无监听ComfyUI 进程层启动报错、进程退出、端口被改
本机能访问,公网不能平台网络层端口未暴露、外部 URL 不正确
运行中 OOM工作流资源层分辨率、时长、参考输入或其他进程占用过高
生成后磁盘爆满存储层视频输出、缓存和模型持续增长

这张表基本就是整篇文章最重要的部分。

13. 数据保存和关机边界

视频模型的磁盘增长很快,除了模型文件,还有输入素材、预览缓存和最终视频。

建议至少定期检查:

du-sh~/ComfyUI/models2>/dev/nulldu-sh~/ComfyUI/input2>/dev/nulldu-sh~/ComfyUI/output2>/dev/null

同时注意:关机停止的是 GPU 实例计算,扩容数据盘不一定随之停止计费。实例释放、数据盘保留和自动释放周期也应以平台最新帮助文档为准。

重要内容建议单独保存:

  • 工作流 JSON;
  • 使用过的提示词;
  • 自定义节点清单;
  • requirements-before-change.txt
  • 模型文件名与来源;
  • 生成结果;
  • 显存监控 CSV。

有这些东西,换实例以后才有可能快速恢复。只保存一张工作流截图,基本没用。

14. 最小验收清单

完成下面这些,再开始调正式任务:

  • nvidia-smi能识别正确 GPU;
  • torch.cuda.is_available()返回True
  • 四类 H3 模型文件可以找到;
  • ComfyUI 进程存在;
  • 8080 端口正在监听;
  • 浏览器可以进入页面;
  • 基础工作流可以提交;
  • 音频和视频结果可以保存;
  • 已记录一次显存峰值;
  • 工作流与重要结果已经备份。

FAQ

RTX 4090 的 24GB 显存能跑 MiniMax H3 吗?

该镜像推荐 24GB 显存和 RTX 4090,适合作为基础工作流的起点。具体能否完成某组参数,要看分辨率、时长、参考输入和工作流中同时加载的模型。

官方说支持 2K,本地工作流为什么从 768 短边开始?

2K 是 MiniMax 公布的模型能力上限;ComfyUI 官方模板对本地工作流的原生画布、尺寸倍数和时长换算有单独说明。模型上限不能直接当作 24GB 显卡的默认参数。

页面打不开,是否需要重装 ComfyUI?

先查进程、8080 端口和平台端口映射。很多页面打不开的问题发生在网络暴露层,重装 ComfyUI 不会解决。

模型文件都在,为什么工作流还是找不到?

重点检查目录、文件名、文件完整性以及 ComfyUI 是否重新扫描。模型放在models根目录,而不是对应子目录,也可能无法识别。

是否应该马上升级到最新版 ComfyUI?

能运行时不建议盲目升级。先保存当前依赖和 Git 提交,再针对具体缺失节点或兼容问题做最小修改。

参考资料

  • MiniMax H3 官方介绍:https://minimaxi.com/blog/minimax-h3
  • ComfyUI 官方 MiniMax H3 工作流:https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_minimax_h3_t2v.json
  • 算家云 MiniMax H3 镜像:https://suanjiayun.com/mirror/6a7ed4efa207ada5e3465db6
← 返回列表