上海 AI 实验室白送 1 亿 token,坑我先替你踩了

上海 AI 实验室白送 1 亿 token,坑我先替你踩了

领 1 亿 token 需要多久?一个邮箱,三十秒,不绑卡、不预充,注册完直接到账。

用明白它需要多久?Reddit 上有人烧了 17 万 token、一百多分钟,让它在一次代码扫描里从 7 个问题里认出了 1 个已知的。

这两个数字放在一起,就是这篇文章要说的事:上海人工智能实验室 9 月 12 日开源的智能体模型 Atria Dawn Preview,官方 API 注册就送 1 亿 token 额度。羊毛在哪、有多厚、坑有多深,我把它能查到的数据都翻了一遍——你领之前,先看这篇。

Atria 官方控制台:1 亿 token 额度到账

(图:注册后的官方控制台,总额度 100,000,000 token,0% 已使用)

先说这模型是什么来头

Atria Dawn Preview 是上海 AI 实验室的新一代智能体模型预览版,底座是 7440 亿参数的 MoE 模型(GLM-5.2 基座),上下文 256K。代码和权重全部按 MIT 协议开源——不是"个人研究可用"那种伪开源,商用也不设限。

我第一时间去 GitHub 核了数据(2026-09-16 实测):仓库创建于 9 月 12 日,四天攒了 402 颗星,最后一次提交就在今天,文档更新非常勤——连 Kimi Code 的接入教程都加进去了。

更有意思的是团队构成。论文(arXiv 2609.15818)作者列表拉了 100 多人,来自复旦、人大、中科院软件所、北大、上交大、哈工大等高校,据社区披露,约三分之二的研发成员是在校的本科生、硕士生和博士生。仓库贡献榜上,主贡献者一人提交占比 57%。一支年轻到发光的队伍,干了件很多大厂没干的事。

榜单很猛,但要拆开看

官方给出的基准成绩相当唬人:多项第一。我把 README 里的表格拆成"强项"和"弱项"两张表,只跟最强对手 Claude Opus 5 和国产同门 GLM 5.3 比:

它的强项(智能体检索、工具调用、安全):

基准 Atria Dawn Claude Opus 5 GLM 5.3
AutomationBench 53.8 49.4 49.2
DeepSearchQA 96.0 94.7
BrowseComp 92.5 90.8
BFCL v4 77.0 74.1
CyberGym 86.5 84.5

它的弱项(硬核编码、办公交付):

基准 Atria Dawn Claude Opus 5 GLM 5.3
SWE-bench Pro 59.6 74.7 60.3
Terminal-Bench 2.1 78.3 90.2 85.4
JobBench 50.3 68.0 58.2
GDPval 1583 1768 1667

规律很清晰:它强在"带着工具跑长流程"——检索证据、调用工具、验证结果,这些智能体原生场景拿了一串第一;但在纯硬核编码上,跟 Opus 5 还差着一截。

还有一个必须说的前提:这张表是发布方自测。第三方评测站 BenchLM 给它的综合编码排名是 152 个模型里的第 51 位,智能体任务第 31 位——比"全部第一"的观感要冷静不少。榜单是官方出的题,分数可以做参考,别当信仰。

1 亿 token 到底能干多少活

注册送 1 亿 token,听起来像个天文数字。我们用 Reddit 用户 r/opencodeCLI 的实测来换算一下:

他让 Atria 接进 OpenCode 跑一次代码库扫描,116 次调用,消耗 127,658 token,加上重试总共烧掉 173,950 token,扫描耗时超过 100 分钟,最后从代码库里找到 7 个问题,其中一个是他本来就知道的老毛病。

按这个消耗强度,1 亿 token 大约够跑 570 次这样的深度扫描。对个人开发者来说,这不是"试试水"的量,是能实打实跑批量任务的量——代码审查、文档批量处理、爬虫数据整理这类长流程任务,都可以敞开了跑。

顺带修正一个预期:这类智能体任务的 token 消耗是聊天界面的几十倍。你平时跟 ChatGPT 聊一天用不了 10 万 token,Agent 干一个正经活就是十几万起步。1 亿额度按"聊天"来估你会觉得用不完,按"Agent 干活"来估就刚刚好。

接进 Claude Code / Codex 的三个坑

这模型不是打开网页就能聊的,官方定位就是把接口填进你现有的工具里。接入本身不难,难的是三个坑,官方 README 都写了,我提前给你捞出来:

坑一:它看不见图。 Atria Dawn Preview 是纯文本模型,图片、PDF、截图一律喂不进去。Codex 用户最容易撞墙——默认把截图粘给模型,直接报 400:Atria-Dawn-Preview is not a multimodal model。解法是官方给的一份 model catalog JSON,把 input_modalities 声明成 ["text"],让 Codex 在客户端就把图片拦掉。注意这个 catalog 是"替换"不是"合并",你切换别的模型时也得把它加进同一个文件。

坑二:Claude Code 要自己写拦截。 Claude Code 也不会主动防着你塞图,官方给的方案是一段 PreToolUse hook 脚本(block_pdf_image_read.py),把 Read 工具读图片和 PDF 的请求直接 deny 掉。脚本 README 里有现成的,抄进 settings.json 就行。

坑三:Kimi Code 的 max_output_size 必须写 65536。 不写的话 Kimi 会把 max_context_size(256000)当输出上限发过去,Atria 只接受 1-65536,直接拒绝。另外 capabilities 里要显式声明 ["tool_use", "thinking"],否则推理功能静默失效。这种"不报错但功能没了"的坑最磨人,照抄官方配置最稳。

一句话总结:会复制粘贴 API 地址和密钥,就能跑起来;但第一次配置时,把官方 README 的接入章节完整读一遍,能省掉一下午的排错。

冷水:领之前想清楚这四件事

第一,它是 Preview。 版本号里带着"预览"两个字,初版还限制了外部素材和新增依赖(社区实测反馈),行为随时可能调整。用它跑生产关键流程,先掂量掂量。

第二,免费额度不是合同。 各路测评博主都在视频里加了一句免责声明:免费额度和限制可能随时变化。领了就尽快用,别当传家宝。

第三,本地部署跟你没关系。 权重虽然是 MIT 开源的,但 744B 的 MoE 模型,FP8 量化版也得专业多卡机才拉得动。SGLang 和 vLLM 的部署教程是给有算力的机构准备的,个人用户的唯一路径就是官方 API。开源的意义在于"你能看到它的五脏六腑",不在于"你能把它抱回家"。

第四,别拿它替代你的主力编码模型。 榜单数据摆在那里:硬核编码不如 Opus 5,跟自家的 GLM 5.3 也只打平。它的正确打开方式是"给智能体流程换一台便宜引擎",而不是"白嫖一个最强模型"。

谁该现在就去领

这三类人,建议立刻动手:想给 Claude Code、Codex、Kimi Code 找个零成本引擎跑长任务的;有批量脚本、代码扫描、文档整理需求想敞开跑的;以及单纯想第一时间摸一讲 744B 智能体模型底细的。

这类人可以先等等:想丢 PDF 和截图让它读的(它瞎)、想本地跑大模型的(它大)、想找个 Opus 平替写核心代码的(它还不够格)。

领取地址分国内国际两条线:国际站 api.atria-asi.ai,谷歌或邮箱注册;国内入口走 discovery.intern-ai.org.cn 的 token 计划页面,不用折腾网络。建一个 API Key,填进你顺手的工具里,三分钟的事。

最后说句实在的:1 亿 token 白给,领了不用也不亏,但这个量级的免费额度在旗舰模型上并不常见——GLM-5.3 那波免费是限时的,这次连限时两个字都没写。它免费多久没人知道,先把额度攥在手里,总没错。


相关链接:

评论

暂无评论。

登录后可发表评论。