15.7G 显存才能跑的视频模型,被一个几百兆的矩阵砍到了 5G
跑过 MiniMax-H3 的人都知道那种感觉:榜单第一的视频模型,开源了,免费,然后你打开显卡——15.7G 显存,光是文本编码器就把 4060 Ti 这种 16G 卡直接劝退。
现在有个方案,把这道门槛砍掉了。
ComfyUI 社区有人写了个叫 ClipProj 的插件,思路简单到有点粗暴:H3 用一个 32B 的大语言模型当文本编码器,把它换成 4B 的小模型,中间垫一个学出来的线性矩阵,把小模型的输出"翻译"回大模型的维度。编码这一步的显存占用,从 15.7 GB 降到了 4.5 GB——整条管线跑下来,5G 显存就能出视频。
被换掉的不是模型,是翻译官
先说清楚 H3 的结构。这个 33B 的视频模型真正生成画面的是 DiT 部分,文本编码器(一个截断过的 Qwen3-VL-32B)只干一件事:把你的提示词变成条件向量喂进去。
也就是说,那 15.7G 显存,全程只负责"读题"。
ClipProj 的作者盯着这一点动手了:既然 32B 的输出最终就是一串向量,那能不能用个 4B 的小模型先算一遍,再用一个学好的线性映射补齐差距?公式只有一行——标准化、乘投影矩阵、反标准化。投影矩阵从 Hugging Face 下载,4B 版本压缩后只有 240 MB。
显卡没换,模型没换,只是给"翻译官"换了个小的,再教它说一样的行话。
实测数据
ComfyUI Wiki 记录了编码器环节的显存对比:
| 编码器配置 | 显存占用 |
|---|---|
| 原装 Qwen3-VL-32B(NVFP4) | 15.7 GB |
| Qwen3-VL-4B + ClipProj(bf16) | 8.3 GB |
| Qwen3-VL-4B + ClipProj(fp8) | 5.2 GB |
| Qwen3-VL-4B + ClipProj(int8_convrot) | 4.5 GB |
fp8 和 int8 两档,显存直接砍掉三分之二。社区还有人做了 int4 和 GGUF 版本,据说 2 到 2.6 GB 就能跑,但作者没验证过,只标了"reported working"。
源文章作者实测跑了段 15 秒视频,4 到 5G 显存搞定。这意味着什么:MiniMax H3 之前的标准配置是单张 RTX 5090,现在 3060 级别的卡也有得玩了——视频生成模型的"最低配置",一个多月里从旗舰卡降到了主流卡。
为什么不直接微调,要"垫"一层
这是整个方案里最值得琢磨的地方。
直接把小模型接上去行不行?不行。4B 和 32B 的输出空间完全对不上,视频模型认的是大模型那一套向量分布,小模型的输出塞进去,画面直接崩。
所以作者训练了一个投影矩阵:拿两个模型对同样的文本各跑一遍输出,让线性层学着把小模型的输出空间"拉"成大模型的形状。训练只针对这个矩阵,主模型一个参数都没动——DiT、VAE、采样器全部保持原装。
这也是它兼容性好的原因:插件返回的对象行为和官方 CLIP 一模一样,现有工作流直接把 clip 输入接上就能用,不用重新连线。
代价与边界
- 这是概念验证,不是稳定工具。作者明说了:只在一套环境(Windows 11 + RTX 3090/4070/3060)上测试过,预期会有不完善之处和破坏性变更。macOS、Linux 用户碰到问题,大概率只能自己踩。
- 画质损失没有公开量化数据。32B 到 4B 的信息量差异客观存在,投影补的是"形状"不是"内容",长提示词、复杂指令的场景下差异可能更明显。目前只能靠实际跑片对比,没有论文级评测。
- 省的是编码器,不是全部。DiT 和 VAE 的显存开销还在,16G 卡跑 2K 依然紧张,省出来的显存更多是"能跑起来"和"跑得舒服"的差别。
- 质量换挡要自己权衡。bf16 / fp8 / int8 三档显存对应不同精度,追求极限省显存的 int8_convrot 档,精度损失需要自己用成片检验。
值得装的理由,和不值得装的理由
值得:你有一张 8-16G 显存的卡,之前对 H3 只能"云评测";或者你已经能跑,但文本编码器常驻显存挤压了分辨率上限。
不值得:你靠这套流程接商业单子——概念验证阶段的工具挂掉一次,交付就凉一次;或者你对画质有硬指标,投影引入的偏差还没人替你验过。
不过方向本身比插件重要。大模型的文本编码器往往是个"安装时庞大、运行时轻量"的部件——读题不需要 32B 的脑子,需要一个学过怎么把题意翻译过去的 4B。如果这条路被验证成熟,以后每个新视频模型发布,社区第一件事可能就是给它配一套"低显存编码器平替"。门槛的下探,从来不靠官方降价,靠的是有人把"跑不起来"变成"跑得起来"。
相关链接:
- ClipProj 插件(GitHub):https://github.com/nicolab28/ComfyUI-ClipProj
- 投影矩阵(Hugging Face):https://huggingface.co/NicoLab28/ClipProj-MiniMax-H3
- MiniMax H3 模型主页:https://huggingface.co/MiniMaxAI/MiniMax-H3
- MiniMax 官方博客:https://www.minimax.io/blog/minimax-h3
- ComfyUI Wiki 实测详解:https://comfyui-wiki.com/zh/news/2026-08-09-clipproj-minimax-h3
暂无评论。