别为一动不动的天空付算力——微软用 4B 参数干了 32B 的活
想象一个盯着街道的监控摄像头。画面里,天空 24 小时不动,建筑不动,道路也不动,真正值得看的,可能只是偶尔走过的一个人、一辆车。
但传统视觉模型看视频的方式,是把每一帧都拆成图片,每一帧都生成一大堆 Token,每一帧都完整算一遍——天空也在算,墙面也在算,大量算力花在了"没有变化"的地方。
微软开源的 Mage 模型家族,把这笔账算明白了。整个家族锁死 4B 参数预算,就讲一件事:
把表示能力,花在信号所在的地方。

先看懂 Mage 是什么
Mage 不是单个模型,而是微软定的一条"固定预算"产品线:所有模型都是 4B,分两条路走。
**Mage-VL 负责"看":图像、视频、文档理解,外加流式视频的实时感知。Mage-Flow 负责"画"**:文生图加自然语言编辑。
7 月 22 日放出 Mage-Flow 权重,7 月 26 日放出 Mage-VL,代码、权重、技术报告全开源。授权也大方:Mage-VL 走 Apache 2.0,Mage-Flow 和 Mage-ViT 走 MIT。
名字也有讲究——Mage,法师。官方封面是一个挥魔杖的巫师,长袍上绣着 MSRA:微软亚洲研究院。
Mage-VL:把视频编码器的智慧搬进大模型
Mage-VL 最核心的一步棋,是问了一个没人认真问过的问题:
为什么看视频要为静止的天空付算力?
老视频编码器几十年前就想通了。H.264/HEVC 里的 I 帧保存完整画面,P 帧只编码"相对上一帧变了什么"。Mage-ViT 把这套 I/P 思想搬了进来:不再给每一帧都发一整版 Token,而是重点编码"哪里变了"。
官方报告的数据:视觉 Token 减少 75% 以上(约为稠密抽帧的 1/8),推理墙钟时间最高快 3.5 倍,省下的预算还能让视频训练长度拉长 8 倍。

更狠的是,Mage-ViT 是从零训练的,不挂在任何现成视觉编码器上,解码端配 Qwen3-4B。同样是 4B 主干,把 Qwen3-VL-4B 的视觉编码器换成 Mage-ViT,官方报告里所有视频与时序定位基准全部反超:QVHighlight +22.5,VSI-Bench +11.0,CrossPoint +53.1。
有事才开口:System 1 / System 2
流式视频才是 Mage-VL 真正的差异化。它给模型装了个"事件门控":
System 1:一个轻量门控,持续盯着视频流,判断"现在值不值得说话";System 2:只有门控打开,才启动完整的多模态推理。
监控画面安安静静,System 1 沉默;有人闯入,门控触发,System 2 开口。官方让它去看 2026 年世界杯的真实直播,进球瞬间自动触发解说——在数据集里训练的能力,直接泛化到了真实直播流。

这其实是对 VLM 一个老毛病的正面回应——莫拉维克悖论:模型能做复杂的离线推理,却在"实时看"这件对人类最简单的事上又慢又贵。
Mage-Flow:4 步画一张图,GenEval 0.90
生成这条线,Mage-Flow 的打法是"原生分辨率"。
多数文生图模型训练时把图塞进固定尺寸的桶(512×512、1024×1024),遇到奇怪比例就裁剪缩放。Mage-Flow 的 NR-MMDiT 直接按图片实际尺寸组织 Token 序列,一个 checkpoint 覆盖 512~2048 像素、任意宽高比,连 4:1 的极端比例都吃——横幅、长图、手机壁纸不再将就。
成绩单是重点。GenEval 0.90,是 4B 参数量级第一个摸到这个分数的模型,放在整个开源圈也是第一梯队:
| 模型 | 参数规模 | GenEval | 峰值显存 |
|---|---|---|---|
| Mage-Flow | 4B | 0.90 | 18.1 GB |
| Qwen-Image | 20B | 0.87 | 58.8 GB |
| Seedream 4.0(闭源) | — | 0.84 | — |
| HiDream-I1-Full | 17B | 0.82 | 65.5 GB |

速度上,Turbo 版通过蒸馏把采样压到 4 步:1024×1024 在 A100 上 0.59 秒一张,编辑 1.02 秒一次。显存对比更夸张——编辑侧 Mage-Flow-Edit-Turbo 只要 18.57 GB,而 FLUX.2 Dev 要 179.63 GB,差着近 10 倍。

生成质量之外,中文用户应该关心另一个细节:Mage-Flow 的中文文字渲染相当能打。官方展示图里,"半生烟火"这样的中文书封直接生成,笔画准确——这在国内应用场景是硬通货。

编辑能力是全家桶式的:换背景、改颜色、加删物体、换字体、上色、改画风、语义分割、姿态估计,全部走"图片加一句话"的交互。

代价清醒:三个别忽略的细节
一,它明确说了"仅供研究"。 README 的 Responsible AI 条款写得很清楚:这些模型仅为研究目的发布,不用于产品或服务部署。想直接拿去做线上产品的,先掂量这一条——MIT 许可证不等于商业部署许可。
二,0.59 秒是 A100 的成绩。 Turbo 版峰值显存 18~20 GB,消费级 24GB 显卡能跑但紧张,速度也会打折扣。想复现官方速度,得有数据中心级的卡。
三,对比数据来自官方自测。 GenEval、GEdit 这些分数是微软报告口径,方向可信,但小数点后一位的差距别太当真,等第三方复现再说。
写在最后
这两年大家卷参数卷累了,Mage 给了另一种示范:参数锁死在 4B,把功夫全花在"算力花在哪"上。视频编码器几十年的压缩智慧、生成链路从 VAE 到 DiT 的逐环优化,最后汇成一句话——别为一动不动的天空付算力。
前几天面壁智能用 2B 模型拿下 4B 以下第一,如今微软把 4B 预算锁死来做多模态。参数竞赛的下半场,比的不再是"有多大",而是同样的预算,你能榨出多少智能。
相关链接:
- GitHub 仓库:https://github.com/microsoft/Mage
- 项目主页:https://microsoft.github.io/Mage/
- Hugging Face 模型合集:https://huggingface.co/collections/microsoft/mage
- Mage-VL 论文:https://arxiv.org/abs/2607.24904
- Mage-Flow 论文:https://arxiv.org/abs/2607.19064
暂无评论。