← 所有系列

MiniMax-H3 × DGX Spark — 六期原理实战

从架构拆解到性能复盘,六期系列完整记录在 DGX Spark(GB10 / 128GB 统一内存)上跑通 MiniMax-H3 文生视频模型的全部过程:134GB 权重怎么装进 128GB、在线动态 FP8 量化、SM121 硬件适配、六连坑失败链与窄补丁、可复现部署流水线、性能账本与方法论。

6 集 含视频
第 1 课
MiniMax-H3 架构拆解:一条 5 秒带声音的视频,背后是哪些模型在干活
134GB 权重不是单个模型,是一组模型的合体:text encoder 63G + 33B DiT 62G + 双 VAE 10G。本期把流水线一个个拆开看。
第 2 课
在线动态 FP8 量化:128GB 怎么装下 134GB 权重
答案不是「塞」,是「换一种方式存」:磁盘权重一个字节没动,vLLM 加载时才现转 FP8——每个数从 16 位变 8 位,内存直接减半。
第 3 课
硬件适配:GB10 统一内存 — 128GB 不是「显存」,是「总预算」
GB10 不是一台「显存很大的 GPU」,而是一台「内存共享的 SoC」。SM121 的四个「不支持」决定了量化与内核的全部选型。
第 4 课
失败链与兼容补丁:六个坑,五次换路,没有一次白踩
从内存超限、INT8 无指令、loader 契约、Triton 编译失败到 AdaLN 精度、FA4 编译失败——每个坑对应一个「窄」补丁。
第 5 课
部署实战:从克隆到出片,一条可复现的流水线
把前四期的原理、量化、硬件、补丁装进一条能跑的流水线:固定 digest 镜像 + 文件级补丁覆盖 + 八个启动参数 + fail-closed 验证链路。
第 6 课
性能与方法论:134GB 跑在 128GB 上的六期复盘
六期收尾:把数字收拢成账本(532s 加载 / 7.75s 每步 / 5s 视频 1235s),把踩坑收拢成方法论(fail-closed 与三步组合拳)。