17 小时写完一个编译器:蚂蚁这次没吹牛,但有个细节它没说清

17 小时写完一个编译器:蚂蚁这次没吹牛,但有个细节它没说清

先看一个数字:17 小时。

一个模型,从零开始写一个 Lua 到 x86-64 的编译器——不是代码片段,是能跑的、产出可执行文件的完整编译器——连续干了 17 个小时,182 项测试通过 178 项,97.8%。中途自己做设计决策、写代码、跑测试、修 bug,全程没人管。

这是蚂蚁百灵 9 月 30 日发布的 Ling-3.1-flash 交出的作业。同一场发布还有两组数字:给 Pyright 做 profiling 优化,10 小时,2279 项回归测试全过,1.4 倍加速;把 C 图像库用 Rust 重写,20 小时,30 项验证全过,8 倍加速。另外它在 OceanBase 开源版里自己挖出了一个栈缓冲区溢出漏洞,还给了补丁。

评测方式也和常见跑分不一样:没有 MMLU,没有 HumanEval,全是真实工程任务,每项标注耗时、测试通过数、验证结果。

但这条新闻里最值得说的,反而不是这些漂亮数字。

先说它没说清的那件事

很多报道标题都写了"1M 上下文免费两周"。这不是官方的说法。

官方原话是:免费体验两周,考虑到综合服务成本,免费期间服务长度为 256K;免费期结束转付费后,才计划开放 1M 上下文,届时同步开源。

也就是说,你现在去白嫖,摸到的是 256K 的版本。1M 是付费墙后面的东西——当然,官方承诺到时候开源,这个诚意在闭源为主的行业里还算难得。

为什么这件事重要?因为 1M 上下文恰恰是 17 小时编译器故事的根基。

17 小时的活,靠什么撑住

Ling-3.1-flash 的参数配置:560B 总参数,每 Token 激活 25B,512 个路由专家里每次只激活 9 个。

这套"大容量、小激活"的 MoE 配置解决的是钱的问题——560B 的知识储备在,但每次推理只算 25B 的量,成本锁得住。

真正让 17 小时连续任务成为可能的,是注意力架构:7 层 KDA(线性注意力)加 1 层 Gated MLA 交替堆叠。线性注意力的特性是长上下文下计算成本不爆炸,配合稀疏路由,1M 窗口下的推理成本才压得下来。

想象一下第 17 个小时的场景:模型面前是 16 个小时攒下来的代码结构、接口约定、变量命名。上下文窗口不够的话,前面写的代码就成了"上个月的记忆"——靠摘要和外部检索拼凑,错一点,整个编译器就断在半路。1M 窗口的意义是让模型直接读,而不是回忆。

这也是为什么它把评测锚点放在"长流程任务"而不是单轮问答——架构就是为这个场景设计的。

官方成绩单:紧贴 Opus 5,但要看清赛道

第三方评测机构 Artificial Analysis 的 GDPVal-AA v2.1 榜单上,Ling-3.1-flash 拿了 1673 Elo——官方 X 账号强调这个分数紧贴 Claude Opus 5(1708),领先 GPT-5.6、Kimi K3、DeepSeek V4.1-Flash。另一边,FrontierSWE 75.16、HealthBench Professional 65.35(医疗场景,训练时吸收了好大夫在线的真实问诊反馈)。

几个冷静的注脚:

ELO 差 35 分不是"打平"。 GDPVal-AA 榜上 Opus 5.5(1692)在它前面,35 分的差距在 Elo 体系里是明确的实力差。正确的读法是:一个主打性价比的 flash 档模型摸到了旗舰榜的门口,而不是"追平 Anthropic"。

FrontierSWE 的版本坑。 FrontierSWE v2 换了任务集和评测框架,官方宣称的 75.16 和 v2 榜上的数字不在一个坐标系里,跨版本对比没有意义。

"超越 GLM-5.3 Flash"的说法来自自媒体。 官方口径是 GDPVal-AA 上领先 GLM-5.3 等模型,具体档位(5.3 还是 5.3 Flash、什么推理档)各家报道口径不一。这一点上,榜单原文比任何标题都可靠。

和上一代比,跳了多大一步

Ling-3.0-flash(124B/A5.1B)当时靠便宜和快出圈——OpenRouter 上 $0.021/M input,实测 400 tokens/s。三个月后,3.1 版本参数翻了 4.5 倍,激活翻了 5 倍,定位从"快而省的办公模型"转向"长流程 Agent 主力"。

这条演进路线其实指向同一个判断:Agent 时代的瓶颈不是单次回答的聪明程度,是连续执行几十个小时不出错的能力。 谁能撑住长流程,谁就接得住真正值钱的活——不只是写代码,还有医疗随访、金融分析、科研实验这类动辄数小时的连续任务。

免费两周,怎么薅

入口两个:Ling Studio(chat.ant-ling.com)和蚂蚁数字科技 MaaS 平台。免费期间 256K 上下文,无需付费。

适合现在就去试的:

  • 有长文档/大代码库要处理的人——256K 在免费期已经够大多数单仓库场景
  • 想跑长流程 Agent 任务的人——17 小时编译器这类玩法,免费期就能验证
  • 等开源的人——官方明确承诺付费后开源,按 Ling 系列惯例(3.0 已开源),权重会落在 HuggingFace

两个提醒:免费期结束后的定价还没公布,别把两周免费当长期成本模型做架构决策;1M 上下文属于付费功能,你的应用如果依赖超长上下文,上线时间表要按官方后续公告来。

一句话总结

17 小时的编译器证明了长流程 Agent 的可行性,1673 的 Elo 证明了 flash 档也能摸旗舰的边——但真正的胜负手,是两周后公布的定价和那份承诺中的开源权重。在那之前,先把 256K 的免费额度用干净。


相关链接:

评论

暂无评论。

登录后可发表评论。