阶跃星辰发布Step 5 Preview:600B总参27B激活,支持1M上下文【AI 早报 2026-09-21】
今日AI领域新品密集落地,阶跃星辰推出600B参数旗舰级Agent模型,阿里开源70亿参数图像生成模型,Qwen系列连发多款大模型、代码模型、安全模型及强化学习算法,YC分享Harness对Agent性能的关键影响,另有低资源持续学习模型、网页生成评测基准、开发者工具更新,以及Stability AI与EA达成游戏AI合作、完成娱乐行业巨头参投的融资。
今日概览
- Show HN:Mini-AGI——可在8GB显存上训练的动态持续学习模型
- Qwen-MT:高速与智能翻译结合的多语言模型
- WebCraftBench:面向AI生成网页的软件测试视角评测基准
- 阿里开源Qwen-Image-2.1:70亿参数声称性能超越闭源图像生成模型
- Qwen3正式发布:深度思考与快速响应并重的大语言模型
- 娱乐行业巨头参投Stability AI最新融资,总融资额达2.32亿美元
- Qwen3-Coder发布:当前最强的开源代码Agent模型
- llm-keys-ui 0.1插件发布:解决远程编码代理的LLM密钥配置问题
- 阶跃星辰发布Step 5 Preview:600B总参27B激活MoE模型,支持1M上下文长程Agent任务
- YC研究分享:Agent性能上限由Harness而非模型决定
- Qwen3Guard发布:首个Qwen家族的安全护栏模型
- GSPO算法提出:解决语言模型强化学习训练不稳定性问题
- 实测Jev模型:速度极快但准确率一般,主打结构化判断的System One模型
- Stability AI与EA达成战略合作,共同开发游戏生成AI工具
大模型与基础能力
Show HN:Mini-AGI——可在8GB显存上训练的动态持续学习模型
该模型由开发者volotat发布,是一款从零开始训练的动态持续学习模型,仅需8GB显存的消费级笔记本即可完成训练。其训练基于单条数据流的batch-1流式输入,无需大规模算力集群即可实现持续学习能力,降低了持续学习技术的入门门槛。该项目已在GitHub平台开源,适合对低资源持续学习场景感兴趣的开发者研究使用。 来源:https://github.com/volotat/mini-AGI/
Qwen-MT:高速与智能翻译结合的多语言模型
Qwen团队推出Qwen-MT(qwen-mt-turbo)多语言翻译模型,基于Qwen3底座训练,使用了万亿级多语言与翻译专属tokens进行微调。该模型支持92种主要官方语言及方言的互译,覆盖全球95%以上人口,可满足多样化的跨语言沟通需求。通过引入强化学习技术,模型在翻译准确性和语言流畅度上均有显著提升,目前已通过Qwen API向用户开放DEMO体验。 来源:https://qwenlm.github.io/blog/qwen-mt/
阿里开源Qwen-Image-2.1:70亿参数声称性能超越闭源图像生成模型
阿里巴巴Qwen团队发布开源图像生成与编辑模型Qwen-Image-2.1,参数量为70亿,可在消费级显卡上运行。该模型支持透明通道生成,最多可同时处理10张参考图,在图像生成质量上声称超越部分闭源模型。目前该模型采用研究许可证,禁止商业使用,商业使用需单独申请Qwen团队颁发的商业许可证。 来源:https://the-decoder.com/alibabas-open-weight-qwen-image-2-1-claims-to-beat-closed-models-in-image-generation-with-just-7-billion-parameters/
Qwen3正式发布:深度思考与快速响应并重的大语言模型
Qwen团队正式发布Qwen3系列大语言模型,旗舰版本为Qwen3-235B-A22B,在编码、数学、通用能力等基准评测中,与DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro等顶级模型表现相当。小参数MoE版本Qwen3-30B-A3B的单token激活参数仅为QwQ-32B的十分之一,性能却超越后者;最小的Qwen3-4B版本性能也与上一代Qwen2相当。 来源:https://qwenlm.github.io/blog/qwen3/
Qwen3-Coder发布:当前最强的开源代码Agent模型
Qwen团队发布Qwen3-Coder系列代码专用模型,首发最强版本为Qwen3-Coder-480B-A35B-Instruct,为480B参数的MoE架构,单token激活参数35B,原生支持256K tokens上下文,通过外推方法可支持1M tokens。该模型在Agentic Coding、Agentic Browser-Use、Agentic Tool-Use三项Agent任务中达到开源模型最优水平,性能与Claude Sonnet 4相当。 来源:https://qwenlm.github.io/blog/qwen3-coder/
Qwen3Guard发布:首个Qwen家族的安全护栏模型
Qwen团队发布Qwen3Guard,是Qwen家族首款安全护栏模型,基于Qwen3底座微调而来,专门用于安全分类任务。该模型可对输入提示词和模型输出进行精准安全检测,提供风险等级和分类标注,支持英语、中文及多语言环境,在主要安全基准上达到当前最优(SOTA)性能。 来源:https://qwenlm.github.io/blog/qwen3guard/
GSPO算法提出:解决语言模型强化学习训练不稳定性问题
Qwen团队提出Group Sequence Policy Optimization(GSPO)强化学习算法,用于解决现有算法(如GRPO)在长训练过程中出现的严重不稳定问题,避免不可逆的模型崩溃。GSPO可实现语言模型强化学习的规模化扩展,进一步提升模型的深度推理和问题解决能力。 来源:https://qwenlm.github.io/blog/gspo/
评测与工具
WebCraftBench:面向AI生成网页的软件测试视角评测基准
腾讯混元团队联合清华大学、北京大学研究者提出WebCraftBench评测基准,将软件测试方法引入AI生成网页的质量评估。该基准包含369条真实用户需求、5088条验收标准,覆盖功能、内容、视觉三类要求,测试了17个前沿模型生成的6273个网页应用。评测流程通过自动插桩记录代码覆盖率,由探索智能体模拟真实用户操作网页,最终从美观度、易用性、需求符合度三个维度打分。在197组人类偏好验证集中,该基准的判断与人类偏好一致率达85.3%,与Code Arena的模型排名Spearman相关系数达0.890。 来源:https://mp.weixin.qq.com/s?__biz=MzkwODU2OTQyNQ==&mid=2247498548&idx=1&sn=558b3cfdc594a8f1d4a91ea892702b4d
llm-keys-ui 0.1插件发布:解决远程编码代理的LLM密钥配置问题
开发者Simon Willison于2026年9月20日发布llm-keys-ui 0.1插件,用于在使用Codex Remote远程控制设备运行编码代理时,无需将LLM API密钥直接粘贴至ChatGPT应用即可完成配置。用户可通过执行uvx --with llm-keys-ui llm keys-ui --all命令获取本地网络或Tailscale设备IP的访问地址,后续通过llm keys get [服务商名称]命令调用存储的密钥。该插件支持anthropic、openai、openrouter等服务商的密钥存储,已存储的密钥值不会明文展示。
来源:https://simonwillison.net/2026/Sep/20/llm-keys-ui/
行业与商业动态
娱乐行业巨头参投Stability AI最新融资,总融资额达2.32亿美元
Stability AI宣布完成7600万美元B轮融资,投资方包括电子艺术(EA)、索尼音乐集团、环球音乐集团、华纳音乐集团等娱乐行业巨头,以及AMD Ventures、Pacific Alliance Ventures等投资机构。本次融资后,Stability AI总融资额达2.32亿美元,资金将用于创意生产产品套件开发、应用研究深化及专业服务团队扩张。Coatue、Greycroft、Kadmos Capital等现有投资方也参与了本轮融资,其中Sean Parker、Eric Schmidt等个人投资者连续两轮跟投。 来源:https://stability.ai/news-updates/stability-ai-latest-funding-backed-by-entertainment-industry-biggest-names
阶跃星辰发布Step 5 Preview:600B总参27B激活MoE模型,支持1M上下文长程Agent任务
阶跃星辰于9月20日发布旗舰模型Step 5 Preview,定位为面向软件工程、专业知识工作、金融领域的长程Agent任务模型。该模型为稀疏混合专家(MoE)架构,总参数达600B,单token激活参数仅27B,激活比例约4.5%,上下文窗口支持1M tokens,原生支持文本、图像、视频输入及文本输出,提供低、中、高三级推理强度,支持流式输出、工具调用、JSON模式、JSON Schema及提示缓存。模型采用窄深(Narrow but Deep)架构,堆叠92层Transformer,为长Prefill中的隐式多跳推理提供更长的信息传播路径。训练采用策略在线长程强化学习,结合MTP-3推测解码、FP8 MoE、KV缓存卸载等技术,实现长程强化学习端到端3倍以上加速。在官方benchmark测试中,Step 5 Preview在FrontierFinance金融评测中得66.4分,DRACO评测得83.3分;代码任务中DeepSWE v1.1得67.7分,StepCodeBench得49.0分,ProgramBench得80.5分。官方演示案例包括调用Blender创建3D资产并接入Three.js应用、持续推进《Pokémon Red》游戏通关等,展示其长程Agent执行能力。模型已上线AGI Bar平台,未来一周内可免费使用,输入价格为每百万token 7元人民币,输出为20元,缓存读取为0.35元,计划于2026年10月15日开源权重。 来源:https://mp.weixin.qq.com/s?__biz=MzkzNDQxOTU2MQ==&mid=2247520782&idx=1&sn=233ee29f524611348e2fb91a2d19b5de
YC研究分享:Agent性能上限由Harness而非模型决定
YC于近期举办Paper Club,主题为《Why the Harness Matters More Than the Model》,由YC合伙人François Chaubard主持,邀请Prime Intellect、斯坦福等机构的研究员分享相关研究。研究显示,同一模型GPT-6 Astra在标准Harness下ARC-AGI-3测试得分62.7%,更换为Provider Adapter Harness后得分达98.6%,分差35.9个百分点,且高分组的成本反而降低约34%,从2.61万美元降至1.73万美元。Harness指大模型完成真实任务时的整套运行框架,包括系统提示词、工具调用、记忆管理、子Agent分工等,目前已成为Agent性能优化的核心方向,DGM等系统已可通过优化Harness将SWE-bench成绩从20%提升至50%。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNTY1MjE2OA==&mid=2247494462&idx=1&sn=adf8c2849a4f781079ec81286e9d9fef
实测Jev模型:速度极快但准确率一般,主打结构化判断的System One模型
TypeSafe公司发布的Jev模型是一款主打结构化判断的System One模型,名称源自丹尼尔·卡尼曼《思考,快与慢》中的快思考系统,放弃文本生成能力,仅输出预先声明的选择、评分或真假判断及对应概率,适用于Agent路由、风险筛查、输出检查等场景。9月15日发布后24小时内,近13%的Vercel付费团队已使用该模型,为Vercel平台历史上 adoption 最快的模型。实测显示,在50条中文电商客服场景的4项判断任务中,Jev平均得分约32分(满分50),完整准确率约64%65.2%,排在低价小模型组第二,平均响应时间仅0.730.75秒,50题总成本约0.002美元,速度与成本均为测试中最低,但准确率低于更高阶的大模型。 来源:https://mp.weixin.qq.com/s?__biz=MzkyNjU2ODM2NQ==&mid=2247633323&idx=1&sn=936abc6916a79b3005f4fc6c42e8653f
Stability AI与EA达成战略合作,共同开发游戏生成AI工具
Stability AI与全球互动娱乐巨头电子艺术(EA)达成战略合作,将共同开发变革性的生成式AI模型、工具和工作流,赋能EA的美术师、设计师和开发者重新定义游戏开发流程。双方将首先聚焦加速基于物理渲染(PBR)材质的创建,通过新的艺术家驱动工作流生成保留精确色彩和光照准确度的2D纹理,后续还将探索3D内容生成、快速原型设计等方向。Stability AI在 volumetric 生成媒体领域处于领先地位,其Stable Fast 3D、TripoSR等模型在Hugging Face上位列最受欢迎的图生3D模型前十。 来源:https://stability.ai/news-updates/stability-ai-and-ea-partner-to-reimagine-game-development
暂无评论。